Quand utiliser Reference to Video
Utilisez Reference to Video lorsque vous avez besoin de :- Cohérence des personnages — la même personne ou le même personnage à travers plusieurs plans
- Précision produit — un produit réel qui doit être identique à l’original
- Continuité de scène — un environnement ou un arrière-plan spécifique à travers les générations
- Scènes multi-personnages — plusieurs personnages distincts interagissant sans se mélanger
Modèles disponibles
Kling O3 utilise une approche structurée avec des Éléments (ancres d’identité de personnage avec image frontale + images de référence) et des Images de scène. Grok Imagine R2V adopte une approche plus simple — vous téléversez directement des images de référence et les référencez dans votre prompt avec
@Image1, @Image2, etc.
Kling O3 Reference to Video
Concepts clés
Kling O3 Reference to Video utilise trois types d’entrée visuelle qui fonctionnent ensemble :
*Au moins l’un de : image de début, éléments ou images de référence de scène est requis.
Éléments
Un Élément est un personnage ou un objet que vous souhaitez garder visuellement stable tout au long de la vidéo. Chaque élément se compose de :- Image frontale (requise par élément) — une photo claire de face du sujet. C’est l’ancre principale d’identité. Considérez-la comme la « photo de passeport » de votre personnage ou produit.
- Images de référence (1–3, optionnelles) — angles supplémentaires du même sujet (vue de côté, angle 45 degrés, dos). Elles aident le modèle à comprendre le sujet en 3D. Si elles ne sont pas fournies, l’image frontale est automatiquement utilisée comme référence.
@Element1, @Element2, etc.
Images de référence de scène
Les références de scène définissent la « scène » où l’action se déroule. Elles influencent :- L’éclairage et la palette de couleurs
- L’architecture et les détails de l’environnement
- Le style visuel global et l’ambiance
@Image1, @Image2, etc. dans votre prompt.
Limitations
Le nombre total d’images à travers tous les types d’entrée est limité :
Exemples de scénarios :
- 7 éléments + 0 image de scène = 7 ✓ (pas de frames)
- 5 éléments + 2 images de scène = 7 ✓ (pas de frames)
- Image de début (1) + 3 éléments + 3 images de scène = 7 ✓
- Image de début (1) + image de fin (1) + 3 éléments + 2 images de scène = 7 ✓
- Image de début (1) + 4 éléments = ✗ (max 3 éléments avec frame)
- Image de début (1) + image de fin (1) + 4 éléments = ✗ (max 3 éléments avec frames)
Chaque élément requiert une image frontale. Si vous ne fournissez pas d’images de référence pour un élément, l’image frontale est automatiquement utilisée comme référence.
Mode multi-plans
Le mode multi-plans vous permet de diviser une seule génération en plusieurs scènes, chacune avec son propre prompt et sa propre durée. Les éléments et références de scène persistent à travers tous les plans, maintenant la cohérence. La durée totale à travers tous les plans ne peut pas dépasser 15 secondes.Guide étape par étape (Video Studio)
1. Ouvrir Video Studio et sélectionner le modèle
Allez sur venice.ai/video. Dans le navigateur de modèles à gauche, sélectionnez l’un des modèles Kling O3 Reference to Video :- Kling O3 Pro R2V — qualité supérieure, temps de génération plus long (~6 min)
- Kling O3 Standard R2V — plus rapide, plus économique pour l’itération
2. Ajouter des entrées visuelles (au moins une requise)
Vous devez fournir au moins une entrée visuelle pour générer une vidéo : une image de début, un élément ou une image de référence de scène. Dans le panneau d’entrée, vous verrez la section Éléments. Cliquez sur Ajouter un élément pour créer un élément pour les personnages ou objets que vous souhaitez garder visuellement cohérents. Pour chaque élément :- Cliquez sur la tuile Frontal pour téléverser une image claire de face de votre personnage ou objet
- Optionnellement, cliquez sur Ajouter sous Images de référence pour téléverser des angles supplémentaires (1–3)
3. Ajouter des images de référence de scène (optionnel)
Sous la section Éléments, vous verrez Images de référence de scène. Téléversez des images qui définissent l’environnement souhaité — un lieu spécifique, une configuration d’éclairage ou un style artistique. Elles sont étiquetées automatiquement comme@Image1, @Image2, etc.
4. Téléverser une image de début (optionnel)
Si vous voulez contrôler la première image exacte de votre vidéo, basculez vers le type d’entrée Image et téléversez une image de début. Vous pouvez également définir optionnellement une image de fin.5. Écrire votre prompt
Dans le champ de prompt, décrivez l’action souhaitée en référençant vos éléments et images de scène à l’aide des tags@ :
6. Configurer les paramètres
Ouvrez Paramètres vidéo pour ajuster :La génération audio ajoute des effets sonores natifs, des dialogues et de l’audio ambiant synchronisés avec la vidéo. Elle augmente le coût d’environ 25 %.
7. Générer
Cliquez sur Générer la vidéo. Kling O3 prend généralement de 4 à 6 minutes selon le palier du modèle et la durée. Vous pouvez mettre en file d’attente plusieurs générations et parcourir les résultats dans la galerie vidéo.Storyboard multi-plans
Pour les séquences narratives, utilisez le mode multi-plans pour définir des scènes distinctes au sein d’une seule génération.- Dans la zone de prompt, cliquez sur Ajouter un plan pour créer des plans supplémentaires
- Écrivez un prompt distinct pour chaque plan
- Définissez la durée de chaque plan (3–15 s chacun, total ≤ 15 s)
Conseils de prompting
Structurez votre prompt
Suivez ce modèle pour des résultats fiables :Gardez les prompts entre 50 et 150 mots
Les prompts trop courts manquent de détails. Les prompts trop longs introduisent des contradictions. Visez le juste équilibre.Utilisez un langage simple pour la caméra
Le modèle répond mieux aux directives de caméra simples :Utilisez un vocabulaire cohérent
Si vous décrivez un personnage portant « a red jacket » dans un prompt, ne passez pas à « crimson coat » dans le suivant. Le modèle traite les mots différents comme des intentions différentes.Placez les instructions de caméra tôt
Placez la direction de caméra près du début du prompt pour des résultats plus fiables :Tarification Kling O3
Les modèles Kling O3 Reference to Video utilisent une tarification basée sur la durée :
Exemple : une vidéo de 10 secondes avec audio = 10 × 0,14 **
Utilisez l’API Video Quote pour obtenir un tarif exact avant la génération.
Utilisation de l’API Kling O3
Kling O3 Reference to Video est également disponible via l’API Venice. Voir l’API Video Queue pour les détails complets.Python
Node.js
cURL
Schéma d’élément
Chaque élément du tableauelements accepte :
L’API prend également en charge
video_url pour les éléments basés sur une vidéo, mais cette option n’est pas actuellement disponible dans l’interface du Video Studio.Dépannage Kling O3
Grok Imagine Reference to Video
Grok Imagine R2V adopte une approche plus simple que Kling O3. Au lieu d’Éléments structurés avec séparation image frontale/référence, vous téléversez des images de référence simples et les référencez directement dans votre prompt avec@Image1, @Image2, etc. Le modèle intègre ces sujets dans la vidéo générée.
Fonctionnement
- Téléversez 1–7 images de référence — des photos de personnages, d’objets ou de scènes que vous souhaitez dans la vidéo
- Écrivez un prompt qui décrit la vidéo, en utilisant
@Image1,@Image2, etc. pour référencer des images spécifiques - Le modèle génère une vidéo intégrant ces références
@Image dans votre prompt, toutes les images téléversées sont référencées automatiquement.
Paramètres
Grok Imagine R2V ne prend pas en charge la génération audio, le mode multi-plans ni les Éléments. Pour ces fonctionnalités, utilisez Kling O3 R2V.
Guide étape par étape (Video Studio)
1. Sélectionner le modèle
Allez sur venice.ai/video. Dans le navigateur de modèles, sélectionnez Grok Imagine R2V.2. Téléverser les images de référence
Cliquez sur Références dans la barre d’outils d’entrée (ou utilisez le menu +) pour ouvrir le panneau d’images de référence. Téléversez 1 à 7 images des personnages, objets ou scènes que vous voulez dans la vidéo. Chaque image est automatiquement étiquetée@Image1, @Image2, etc. dans l’ordre où vous les téléversez (de gauche à droite).
3. Écrire votre prompt
Décrivez la vidéo souhaitée. Utilisez les tags@Image pour référencer des images spécifiques :
@ dans le champ de prompt pour voir un menu d’autocomplétion des références d’image disponibles.
4. Configurer les paramètres et générer
Ouvrez Paramètres vidéo pour ajuster le ratio d’aspect, la résolution et la durée. Cliquez sur Générer la vidéo.Tarification Grok Imagine R2V
Grok Imagine R2V utilise une tarification basée sur la durée et la résolution :
Exemple : une vidéo de 8 secondes en 480p = 8 × 0,063 **
Grok Imagine facture des frais de modération de contenu pour les vidéos générées, même si la vidéo est rejetée. Cela est reflété dans le coût en crédits affiché avant la génération.
Utilisation de l’API Grok Imagine R2V
Python
Node.js
cURL
Paramètres de l’API
Grok Imagine R2V n’utilise pas les champs
elements, image_urls ou imageUrl. Toutes les images de référence sont passées via referenceImageUrls.