Tous les articles
·Mike Serfort·11 min de lecture

Prompts vidéo IA pour pubs produit : modèles qui marchent (2026)

En bref — Un bon prompt vidéo IA pour une pub produit tient en un paragraphe, dans un ordre fixe : caméra, sujet et action, décor, lumière, rendu. Il se termine par une courte ligne de garde-fous (pas de texte à l'écran, parlé ou muet). Trois règles comptent plus que la formulation. N'écrivez jamais le texte de votre étiquette ou de votre logo dans le prompt : laissez la photo produit le porter. Décrivez le mouvement, pas le produit, quand vous animez une photo. Répétez une ligne de continuité à partir du plan 2 pour que trois plans générés séparément se montent comme une seule pub. Ci-dessous : la formule, les règles, et des modèles à copier-coller pour une pub de 3 plans, en version voix off et en version parlée.

Transparence : Klaivo est notre produit. Il écrit ces prompts automatiquement, et les règles ci-dessous sont celles que notre chaîne de production applique à chaque pub, sur Veo 3.1, Seedance 2.0 et Kling 3.0. Les conseils propres à chaque modèle renvoient à la documentation de son éditeur.

Pourquoi la plupart des prompts de pub produit échouent

Les prompts copiés depuis les vitrines de vidéo IA sont écrits pour de belles images. Les pubs produit échouent de quatre façons précises et prévisibles :

  1. L'étiquette se déforme. Le modèle redessine le texte de l'emballage et se trompe de lettres. Les acheteurs le voient tout de suite.
  2. Le produit dérive. Le plan 1 montre votre flacon ; au plan 3, c'est un flacon légèrement différent.
  3. Les plans ne se raccordent pas. Trois plans générés indépendamment atterrissent dans trois pièces différentes, avec trois éclairages différents.
  4. Des personnes parlent quand vous ne le vouliez pas (ou articulent sans son quand vous le vouliez). Le comportement audio n'était pas précisé.

Chaque règle ci-dessous existe pour empêcher l'un de ces problèmes.

La formule en 5 parties

Le guide de Google pour Veo 3.1 structure un prompt en cinématographie + sujet + action + contexte + style et ambiance (Google Cloud). Pour les pubs produit, nous gardons la même ossature, dans cet ordre, en anglais : les modèles vidéo suivent le vocabulaire caméra et lumière anglais de façon plus fiable, même quand la voix off est en français.

# Case Quoi écrire Exemple (en anglais)
1 Caméra Valeur de plan, mouvement, objectif "Macro close-up, slow dolly-in, shallow depth of field"
2 Sujet et action Ce qui se passe, lentement et physiquement "a hand lifts the provided product bottle and turns it toward camera"
3 Décor Un seul décor stable, avec ses matières "on a light oak bathroom counter, white tiles behind"
4 Lumière Source et qualité "soft morning window light from the left"
5 Rendu Le style de la pub "clean premium e-commerce look, natural colors"
+ Garde-fous Texte et comportement audio "clean frame, no text overlays, no watermarks, silent motion"

Assemblé :

Macro close-up, slow dolly-in, shallow depth of field: a hand lifts the provided product bottle and turns it toward camera, on a light oak bathroom counter with white tiles behind, soft morning window light from the left, clean premium e-commerce look with natural colors. Clean frame, no text overlays, no watermarks, silent motion, subject has closed lips.

Règle 1 : n'écrivez jamais le texte de l'étiquette dans le prompt

C'est la règle la plus précieuse pour les pubs produit, et la moins évidente. Si vous écrivez "a bottle labeled GLOWLAB Vitamin C Serum", le modèle essaie de dessiner ces lettres, et les modèles vidéo IA sont de piètres typographes.

À la place :

  • Donnez au modèle la vraie photo de votre produit (image-to-video) et laissez l'image porter l'étiquette.
  • Désignez le produit de façon générique : "the provided product bottle", "the jar", "the item on the table".
  • Demandez un mouvement qui garde l'étiquette lisible : rotations lentes, étiquette face caméra, pas de tour rapide.

Nous l'appliquons à chaque génération, et c'est aussi pour ça que l'image-to-video bat le text-to-video en e-commerce. Le raisonnement complet est dans l'image-to-video pour les pubs produit.

Règle 2 : quand vous animez une photo, décrivez le mouvement, pas le produit

En image-to-video, le modèle voit déjà votre produit. Redécrire sa forme, sa couleur et sa matière entre en concurrence avec l'image et pousse le modèle à la « corriger ». Consacrez vos mots à ce que l'image ne dit pas :

  • Mouvement de caméra : travelling avant, orbite, panoramique vertical, léger mouvement à la main.
  • Action : une main entre dans le champ, le bouchon se visse, un liquide coule.
  • Changement de lumière : un reflet glisse sur le verre, le soleil réchauffe la scène.

Un test utile : si une phrase de votre prompt reste vraie pour la photo immobile, supprimez-la.

Règle 3 : ajoutez une ligne de continuité dès le plan 2

Chaque plan d'une pub de 3 plans est une génération séparée, sans mémoire des autres. Sans consigne, vous obtenez trois pièces différentes. À partir du deuxième plan, ouvrez le prompt par une ligne de continuité explicite :

Visual and light continuity with the previous scene, in the exact same bathroom with light oak counter and soft morning window light…

Deux habitudes rendent la méthode fiable :

  • Choisissez un seul décor pour toute la pub et répétez ses mots-clés à l'identique (même plan de travail, même carrelage, même direction de lumière).
  • Gardez la case rendu identique sur les trois plans. Passer de "premium e-commerce look" à "cinematic look" en cours de pub suffit à casser le raccord.

Règle 4 : décidez explicitement si ça parle ou non

Les modèles récents génèrent du son, et Veo 3.1 le fait systématiquement (documentation de l'API Gemini). Si vous ne précisez rien, vous aurez des murmures improvisés ou des bouches qui bougent sous votre voix off. Choisissez un mode par pub :

Pubs en voix off (le produit est le héros). Terminez chaque prompt par :

silent motion, subject has closed lips, calm expression, no speaking.

Pubs parlées (la personne est l'héroïne). Mettez la réplique exacte entre guillemets, dans la langue visée (les guillemets pour les dialogues sont aussi la convention documentée par Google) :

…a woman in her late 20s speaks naturally to camera with realistic lip-sync. She says out loud in French, clearly and naturally: "J'ai arrêté d'acheter trois sérums le jour où j'ai essayé celui-ci."

Limitez chaque réplique à 8 à 12 mots par plan de 5 secondes : c'est ce qui tient. Le raisonnement complet est dans la structure de pub vidéo qui vend.

Règle 5 : des modificateurs de style qui décrivent la lumière et la caméra, pas des adjectifs

« Magnifique » et « haute qualité » ne font rien. Un style fonctionne quand il nomme un comportement de caméra et un éclairage. Les modificateurs que nous utilisons :

Style Modificateurs qui changent vraiment le rendu
UGC hand-held smartphone camera, subtle natural movement, soft daylight by a window, everyday apartment, natural tones
E-commerce close-up detail shots, studio softbox key and fill light, neutral clean backdrop, focus on texture and use
Luxe slow motion, rim light and backlight, delicate specular reflections, minimalist set, deep shadows
Cinématique anamorphic lens look, high-contrast side lighting, shallow depth of field, volumetric light rays

Modèles à copier-coller : une pub produit en 3 plans

Remplacez les parties entre crochets. Gardez tout le reste, en particulier la ligne de continuité et les garde-fous finaux.

Version voix off (le produit d'abord)

Plan 1 — accroche

Macro close-up, fast push-in with a subtle speed ramp: [a hand grabs the provided product] and brings it toward camera, [on a clean kitchen counter], [warm morning light], [clean premium e-commerce look]. Clean frame, no text overlays, no watermarks, silent motion, no speaking.

Plan 2 — bénéfice

Visual and light continuity with the previous scene, in the exact same [kitchen counter] setting. Medium close-up, slow orbit: [the product in use — e.g. powder dissolving in a glass of water], [warm morning light], [clean premium e-commerce look]. Clean frame, no text overlays, no watermarks, silent motion, no speaking.

Plan 3 — appel à l'action

Visual and light continuity with the previous scene, in the exact same [kitchen counter] setting. Slow dolly-in to a final packshot: the provided product standing upright, label facing camera, [warm morning light], soft glossy reflections, [clean premium e-commerce look]. Clean frame, no text overlays, no watermarks, silent motion.

Script de voix off en parallèle (8 à 12 mots chacun) : « Votre coup de barre de 15 h n'est pas une question de sommeil. » · « Une dose, zéro sucre, une énergie stable pendant des heures. » · « Essayez-le 30 jours — lien juste en dessous. »

Version parlée (la personne d'abord)

Plan 1 — accroche

Vertical selfie-style shot, hand-held smartphone camera with subtle natural movement: [a woman in her late 20s] in [a bright bathroom] looks straight into camera with a surprised expression, [soft daylight from a window], authentic UGC look. She says out loud in [French], clearly and naturally: "[Accroche, 8 à 12 mots]"

Les plans 2 et 3 reprennent la même personne, la même pièce et la même lumière, s'ouvrent sur la ligne de continuité et portent chacun une réplique entre guillemets : le bénéfice, puis l'appel à l'action.

Notes par modèle

  • Veo 3.1. Des plans de 4, 6 ou 8 secondes, et le 1080p ou la 4K seulement en 8 secondes. Google documente le prompt horodaté ([00:00-00:02] … [00:02-00:04] …) pour caser plusieurs temps dans un plan, utile pour une accroche rapide (Google Cloud). Pour les exclusions, Google conseille de les décrire concrètement dans la scène (« un paysage désolé sans bâtiments ni routes ») plutôt que par une simple négation (« pas de constructions humaines »).
  • Kling 3.0. Jusqu'à 15 secondes par plan, avec génération multi-plans et dialogues à plusieurs personnages (Kling). Adapté quand un long plan parlé remplace trois plans courts.
  • Seedance 2.0. Accepte plusieurs images, vidéos et extraits audio de référence dans une seule requête (ByteDance). Avec une seule photo produit, les règles ci-dessus s'appliquent telles quelles.

Quel modèle choisir pour quel plan, avec les coûts : Seedance 2.0 vs Kling 3.0 vs Veo 3.1 pour vos pubs vidéo.

Liste de vérification avant de générer

Avant de lancer, vérifiez que le prompt :

  • suit caméra → sujet et action → décor → lumière → rendu ;
  • ne contient aucun nom de marque ni texte d'étiquette ;
  • désigne le produit par "the provided product…" quand une photo est jointe ;
  • nomme un seul décor, répété à l'identique dans chaque plan ;
  • ouvre les plans 2 et 3 par une ligne de continuité ;
  • précise le mode audio (muet lèvres fermées, ou réplique entre guillemets) ;
  • limite chaque réplique à 8 à 12 mots ;
  • emploie des mots de lumière et de caméra plutôt que des adjectifs creux.

FAQ

Faut-il écrire les prompts vidéo IA en anglais ?

Oui pour le prompt visuel : les modèles suivent plus fidèlement le vocabulaire caméra et lumière en anglais. La réplique parlée ou la voix off peut être en français ou dans toute langue prise en charge par le modèle ou la voix ; indiquez cette langue explicitement dans le prompt.

Pourquoi l'étiquette de mon produit est-elle déformée en vidéo IA ?

Le plus souvent parce que le texte de l'étiquette est écrit dans le prompt, ou parce que le produit a été généré à partir d'un texte plutôt que d'une photo. Retirez le texte, joignez la vraie image du produit et demandez un mouvement lent qui garde l'étiquette face caméra.

Quelle longueur pour un prompt vidéo ?

Assez pour remplir les cinq cases, soit en général 40 à 80 mots par plan. Au-delà, les adjectifs en plus changent rarement le résultat et peuvent diluer les consignes qui comptent.

Peut-on utiliser le même prompt sur Veo, Kling et Seedance ?

La structure se transpose bien. Adaptez la longueur à la durée du plan de chaque modèle (8 secondes sur Veo contre 5 sur Kling et Seedance), et rappelez-vous que Veo génère toujours du son : les pubs en voix off ont besoin du garde-fou muet.

Est-ce que je dois écrire les prompts moi-même ?

Non. Des outils comme Klaivo écrivent le script et les prompts de chaque plan à partir d'une fiche produit ou d'une photo, en appliquant ces règles automatiquement. Elles restent utiles quand vous voulez retoucher un plan à la main.

Envie d'essayer sur votre produit ?

Créez votre première pub