Dans Leonardo, la question n'est plus « quel outil de génération vidéo utiliser » mais « quel modèle, dans quel mode ». La plateforme regroupe plus de trente moteurs vidéo différents — Veo 3.1 de Google, Kling de Kuaishou, Hailuo de MiniMax, Seedance de ByteDance, LTX-2 de Lightricks, et une dizaine d'autres — chacun avec ses propres règles sur le son, les images de référence et le prix. Choisir le mauvais modèle, c'est payer pour une vidéo muette qu'on voulait sonore, ou attendre dix minutes une génération qu'un modèle deux fois moins cher aurait produite en quelques secondes.
Cet article détaille les deux questions à trancher avant de lancer une génération, un comparatif chiffré des coûts (sourcé, avec ses limites), et la technique qui permet de tester sans se ruiner : générer en petite définition, puis agrandir en local. Pour choisir un modèle d'image plutôt que de vidéo dans Leonardo, j'ai un comparatif dédié aux modèles image.
Les deux questions à trancher avant de choisir un modèle
Voulez-vous du son, et lequel ?
Une partie des modèles vidéo génère un son synchronisé — dialogues, bruitages, ambiance — dans la même passe que l'image. D'après la documentation de Leonardo, ces modèles incluent Veo 3.1, Kling 2.6, FLUX 3 Video, MiniMax H3 et Grok Imagine 1.5. Les autres, dont Hailuo 2.3, Seedance 1.0, Kling 2.5 Turbo et LTX-2 dans sa version de base, produisent une vidéo muette par défaut : il faut ajouter le son en post-production, ou passer par les modèles audio dédiés de Leonardo (Music, Dialogue, Sound Effects).
Le piège le plus fréquent : si votre modèle génère du son mais que vous ne décrivez pas précisément ce qu'il doit contenir, il génère « ce qu'il pense être approprié ». Pour un aboiement, un bruit de moteur ou une réplique précise, il faut le nommer explicitement dans le prompt — sans quoi le résultat est souvent trop vague ou décalé.
Image de référence, image de départ, ou image de départ et de fin ?
C'est la distinction la moins bien comprise, et elle change complètement le résultat :
- Image de référence (Reference-to-video, « Image Ref » dans Leonardo) : l'image guide le sujet, l'apparence ou le style, mais le modèle peut recomposer la scène librement. C'est le bon choix pour une simple inspiration.
- Image de départ (Start Frame, Image-to-video) : le modèle anime littéralement la composition fournie, sans la réinventer. C'est le bon choix quand le cadrage exact de l'image doit être préservé.
- Image de départ et de fin (Start & End Frame) : le modèle interpole entre les deux images. Ça fonctionne bien si les deux images sont visuellement proches — sur des modèles comme Veo 3.1, un écart trop important (par exemple un jour ensoleillé qui devient une nuit orageuse) produit des artefacts de morphing. Le conseil de Leonardo lui-même est d'ailleurs de se limiter à une image de départ pour des résultats plus fiables, et de laisser le modèle prédire la fin.
Sur Leonardo, tous les modèles ne proposent pas les trois modes. Kling 2.1 Pro, par exemple, est le seul de la famille Kling 2.x à gérer le départ et la fin ; Kling Omni (O1, O3) accepte plusieurs images de référence à la fois, ce qui en fait le meilleur choix quand un personnage doit rester identique sur plusieurs plans.
Point de vigilance : si vous voulez qu'un élément précis de votre image (une plaque d'immatriculation, un logo, un visage) reste identique pendant tout le mouvement, aucun mode ne le garantit à 100 %. C'est un guidage, pas une contrainte stricte — prévoyez de vérifier chaque passage où l'élément est visible, et éventuellement de corriger en post-production.
Si votre logo ou votre personnage se déforme encore après plusieurs essais, je peux chercher avec vous le bon mode et le bon prompt en une heure de consultation, résultat obtenu ou remboursé.
Les modèles vidéo disponibles dans Leonardo, en un coup d'œil
Leonardo publie sa propre grille de lecture des modèles qu'il héberge. Voici les familles principales, condensées :
| Modèle | Points forts | Cas d'usage |
|---|---|---|
| Seedance 2.5 & 2.0 | Transfert de mouvement vidéo-à-vidéo, contrôle caméra précis, jusqu'à 4K | Édition de vidéo, scènes à caméra contrôlée, production quotidienne rapide |
| FLUX 3 Video | Jusqu'à 20 s, audio natif, seul modèle capable de prolonger un clip existant | Récits multi-scènes avec dialogue, extension de clips |
| MiniMax H3 | 2K avec audio stéréo natif (dialogue, ambiance, musique) | Teasers de marque, vidéos produit, personnages qui parlent |
| Veo 3.1 | Visuels nets, forte adhérence au prompt, audio natif | Publicité, vitrines produit, vidéos corporate |
| Kling 3.0 & 3.0 Turbo | Jusqu'à 15 s, multi-plans (6 coupes), dialogue bilingue natif | Vidéos cinématiques multi-plans, storyboards automatisés |
| Kling Omni (O1, O3) | Édition de vidéo existante, cohérence de personnage via références multiples | Retirer un objet, changer un décor, transfert de style |
| Kling 2.x (2.1, 2.5, 2.6) | Mouvement dynamique, transitions par image ; 2.6 = seul avec audio natif | Action, révélations « avant/après », plans cinématiques sonores |
| Seedance 1.0 | Récit multi-plans, cohérence de personnage entre les coupes | Formats courts verticaux (9:16), contenus réseaux sociaux |
| Hailuo 2.3 | Physique complexe (danse, arts martiaux) sans distorsion ; modèle « Unlimited » | Animation de personnage, contenu stylisé (anime, 3D) |
| LTX-2 | 4K natif, haute stabilité sur les plans longs | Plans d'établissement, B-roll documentaire, diffusion professionnelle |
| Motion 2.0 | Rapide, contrôles caméra dédiés (pan, zoom, tilt) ; modèle « Unlimited » | Teasers réseaux sociaux, tests rapides d'angle de caméra |
Zoom sur les modèles qui comptent le plus
Veo 3.1 — le standard publicitaire
Développé par Google DeepMind. Veo 3.1 Fast sert à prototyper vite et pas cher ; Veo 3.1 (standard) livre du 1080p propre avec un son riche, pensé pour un rendu client. Les deux gèrent le départ et la fin.
Point faible documenté : l'image de fin devient un piège si elle est trop différente de l'image de départ — le modèle produit alors des artefacts de morphing en tentant de combler l'écart. Autre limite : Veo 3.1 a tendance à un rendu léché qui restitue mal les textures brutes ou « lo-fi ».
Kling — trois générations qui coexistent
Kuaishou maintient plusieurs générations en parallèle dans Leonardo, avec des usages distincts :
- Kling 2.5 Turbo (Standard et Pro) : rapide et pas cher, pas d'audio natif, image de départ uniquement.
- Kling 2.1 Pro : le seul modèle de la famille 2.x qui gère à la fois l'image de départ et l'image de fin, pour relier deux images distinctes.
- Kling 2.6 : seul modèle de la famille 2.x avec audio natif synchronisé (dialogues, bruitages, musique), 1080p, 5 à 10 secondes.
- Kling 3.0 / 3.0 Turbo : jusqu'à 15 secondes, multi-plans avec jusqu'à 6 coupes de caméra distinctes, dialogue bilingue. Attention : forte tendance au photoréalisme même quand on demande un style animation — il faut ancrer la génération avec une image de référence stylistique pour contourner ce biais. Les temps de génération peuvent dépasser 10 minutes en heure de pointe.
- Kling Omni (O1, O3) : le seul capable d'éditer une vidéo existante en langage naturel (« retire la voiture », « change la météo ») et d'accepter 3 à 5 images de référence pour garder un personnage reconnaissable sur plusieurs scènes. En contrepartie, le rendu est parfois un cran en dessous de Veo ou Kling 3.0 en photoréalisme pur, et les temps de génération sont plus longs.
Hailuo 2.3 (MiniMax) — la physique complexe, sans le son
Excellent sur les mouvements continus et complexes (danse, arts martiaux, animation de personnage) sans la distorsion qu'on voit ailleurs. Sa faiblesse : un biais « 3D » marqué — sans image de départ réaliste, le rendu ressemble davantage à un jeu vidéo qu'à une prise de vue réelle. Il ne génère pas d'audio natif. C'est aussi, au moment de la rédaction, le modèle par défaut de Leonardo pour la vidéo, et l'un des modèles en génération « Unlimited » sur les plans payants (voir plus bas).
Seedance (ByteDance) — le récit multi-plans
Conçu par l'équipe Seed de ByteDance (TikTok, CapCut), entraîné sur les rythmes visuels du format court. Trois variantes sur Leonardo : Pro (1080p stable), Pro Fast (le plus économique, pensé pour les tests) et Lite (l'équilibre coût/qualité/vitesse). Seedance 1.0 est muet par défaut et gère moins bien la physique complexe que Hailuo, mais il excelle pour enchaîner plusieurs plans cohérents (plan large → gros plan) dans une seule génération verticale 9:16.
LTX-2 (Lightricks) — la résolution avant tout
Seul modèle du lineup à proposer nativement le 4K avec une image de très haute fréquence. Idéal pour les plans lents et stables (paysages, documentaire) ; nettement moins à l'aise sur l'action rapide, où il peut produire des artefacts.
Motion 2.0 — l'outil du quotidien
Pensé pour la vitesse : transformer une image fixe en boucle de 5 secondes avec un simple contrôle de caméra (pan, zoom, tilt), sans compréhension physique poussée. C'est aussi l'un des modèles en génération « Unlimited » sur les plans payants — le bon réflexe pour tester un angle de caméra avant de passer à un modèle plus coûteux.
Combien ça coûte réellement ?
Leonardo facture désormais en dollars sur son API (modèle « Pay-As-You-Go »), mais ne publie pas de grille tarifaire publique détaillée par modèle : le coût dépend de la charge GPU au moment de la génération, et seul le calculateur de prix intégré à l'application donne un chiffre exact avant de lancer une génération.
Pour comparer les modèles entre eux, l'ordre de grandeur le plus fiable et public vient de fal.ai, une API qui héberge les mêmes modèles sous-jacents et affiche ses tarifs au grand jour. Ce ne sont pas les prix facturés dans l'interface Leonardo, mais un repère relatif fiable entre modèles :
| Modèle | Tarif indicatif (API fal.ai) | Son |
|---|---|---|
| Veo 3.1 Lite | 0,03 à 0,08 $/s selon résolution | En option (+coût) |
| Veo 3.1 Fast | 0,10 $/s sans son · 0,15 $/s avec son | En option (+50 %) |
| Veo 3.1 (standard) | 0,20 $/s sans son · 0,40 $/s avec son (1080p) | En option (+100 %) |
| Kling 2.5 Turbo Pro | 0,07 $/s (5 s = 0,35 $) | Pas d'audio natif |
| Kling 3.0 Turbo | 0,112 à 0,14 $/s | Natif selon variante |
| Kling O3 (Omni, 4K) | 0,42 $/s | Natif |
| Hailuo 2.3 (standard, 768p) | ~0,047 à 0,056 $/s | Pas d'audio natif |
| Seedance 1.0 Pro (1080p) | ~0,12 $/s | Muet par défaut |
| LTX-2 (1080p → 4K) | 0,06 $/s → jusqu'à 0,24 $/s en 2160p | Selon variante |
| MiniMax H3 (480p → 4K) | 0,05 $/s → 0,16 $/s | Natif stéréo |
Ce qui saute aux yeux : l'audio double quasiment toujours le prix, et la 4K coûte 2 à 4 fois plus cher que le 1080p sur les modèles qui la proposent. Sur un test de 4 secondes avec image de référence et audio activé, comptez par exemple environ 0,60 $ avec Veo 3.1 Fast, contre 0,20 $ avec Veo 3.1 Lite — pour un rendu plus modeste mais suffisant pour valider un prompt avant de passer à la version finale.
Avant d'engager un budget de production, vous pouvez me soumettre vos plans : pendant une consultation d'une heure, nous choisissons les modèles et les réglages qui tiennent dans votre enveloppe, avec la garantie résultat obtenu ou remboursé.
Ce comparatif se limite volontairement aux modèles disponibles dans Leonardo. Pour une vue plus large incluant les abonnements grand public (Kling AI, Runway) et les modèles open source à faire tourner sur son propre GPU, j'ai détaillé cette comparaison dans un article séparé sur le vrai prix de la génération vidéo IA.
Tester sans dépenser : les modèles « Unlimited » de Leonardo
Leonardo propose quatre paliers payants (Essential à 12 $/mois, Premium à 30 $/mois, Ultimate à 60 $/mois, en plus du plan gratuit). Sur le plan Ultimate — et sur les plans Team (Starter, Growth) —, une poignée de modèles vidéo passent en génération « relaxed » illimitée : d'après la page tarifaire officielle, il s'agit actuellement de Motion 1.0, Motion 2.0, Motion 2.0 Fast, Hailuo 2.3, Hailuo 2.3 Fast et Wan 2.6. Concrètement, une fois l'abonnement payé, vous pouvez générer autant de vidéos que vous voulez avec ces modèles sans consommer de tokens — seule la file d'attente peut ralentir en cas de forte demande.
C'est le point de départ le plus économique pour tester un prompt, un mouvement ou un cadrage avant de passer à un modèle payant à l'usage comme Veo 3.1 ou Kling Omni. Leonardo recommande d'ailleurs explicitement cette approche dans sa documentation : utiliser les variantes « Fast » ou les modèles illimités pour dégrossir l'idée, puis ne passer au modèle « poids lourd » qu'une fois le prompt calé.
Générer en petite définition, puis agrandir en local : la technique qui fait économiser
Puisque le prix grimpe avec la résolution, une approche efficace consiste à générer en 720p ou même plus bas, puis à augmenter la définition après coup, en local, sur son propre ordinateur. C'est la même logique que pour les images fixes — mais avec un piège spécifique à la vidéo qu'il faut connaître avant de s'y lancer.
Point de vigilance : un upscaler d'image n'est pas fait pour la vidéo. Upscayl, que j'utilise pour agrandir des images fixes avant impression, traite chaque frame indépendamment s'il est appliqué image par image à une vidéo. Résultat : du scintillement (« flicker ») d'une frame à l'autre, chaque détail fin bougeant légèrement même quand l'image individuelle semble nette. C'est le même problème avec la plupart des outils basés sur Real-ESRGAN utilisés en mode frame-by-frame.
Pour une vidéo, il faut un outil pensé pour la cohérence temporelle — qui analyse plusieurs frames ensemble plutôt qu'une à une :
- Topaz Video AI (payant, licence à vie) est la référence : il maintient la cohérence entre les frames et gère spécifiquement les artefacts typiques des vidéos générées par IA (textures qui scintillent, détails instables).
- Video2X (open source, gratuit) automatise un pipeline d'upscaling vidéo frame-by-frame avec interpolation, une alternative correcte si le budget est nul — au prix d'une qualité inférieure à Topaz sur les scènes à fort mouvement.
- L'upscaling intégré à Leonardo : certains modèles proposent un upscaling vidéo directement dans l'interface, sans sortir de la plateforme. C'est l'option la plus simple si le modèle utilisé le permet.
Le calcul économique reste le même que pour les images : générer une vidéo de test à bas coût pour valider le prompt et le mouvement, puis n'investir dans la définition finale (upscaling local ou régénération en haute résolution) que sur les plans retenus.
Votre vidéo agrandie scintille, ou vous hésitez entre Topaz, Video2X et l'upscaling intégré à Leonardo ?
❋ Réserver 1h de consultation ❋ Résultat obtenu ou rembourséQuel modèle pour quel besoin ?
| Besoin | Modèle recommandé |
|---|---|
| Tester un prompt sans dépenser | Hailuo 2.3, Motion 2.0 ou Wan 2.6 (Unlimited sur le plan Ultimate) |
| Publicité, vitrine produit, cohérence stricte | Veo 3.1 |
| Action dynamique, danse, arts martiaux | Hailuo 2.3 ou Kling 3.0 Turbo |
| Personnage identique sur plusieurs plans | Kling Omni (O1/O3) ou MiniMax H3 |
| Éditer une vidéo déjà générée (retirer un objet, changer un décor) | Kling Omni (O1/O3) |
| Plan large, documentaire, diffusion professionnelle | LTX-2 |
| Récit multi-plans pour réseaux sociaux (9:16) | Seedance 1.0 ou 2.0 |
| Clip long avec dialogue et son natif | FLUX 3 Video ou MiniMax H3 |
Ce que j'enseigne en formation
Choisir le bon modèle vidéo fait partie des compétences que je montre en formation, parce qu'elle illustre un principe plus large : avec l'IA générative, la compétence ne consiste plus à savoir utiliser un seul outil, mais à savoir lequel choisir, dans quel mode, pour quel budget.
Dans une formation, on peut apprendre à :
- distinguer image de référence, image de départ et image de fin selon le résultat recherché ;
- rédiger un prompt qui précise explicitement le son, le mouvement de caméra et la vitesse ;
- construire un budget de test réaliste avant de lancer une production en haute résolution ;
- mettre en place un flux « génération basse résolution + upscaling local » pour réduire les coûts récurrents ;
- appliquer les mêmes principes de choix d'outil à la génération d'image, de texte et d'audio.
Vous voulez apprendre à produire du contenu avec l'IA sans y passer vos soirées ?
❋ Se former à l'IA ❋La bonne question à se poser
La question n'est pas : « quel est le meilleur modèle vidéo IA ? » Il n'y en a pas. La bonne question est : quel modèle correspond à ce plan précis, avec ce budget précis — et Leonardo a l'avantage de permettre de changer de moteur sans changer d'interface ni d'abonnement.
Sources utiles
- Leonardo.Ai — AI Video Generation Models: What to Use & When
- Leonardo.Ai — Pricing (plans et génération « Unlimited »)
- Leonardo.Ai — Pricing & Plans FAQ
- Leonardo.Ai — Centre d'aide : générer une vidéo
- fal.ai — Tarifs publics des modèles vidéo (Veo, Kling, Hailuo, Seedance, LTX, MiniMax H3)
- Topaz Labs — Upscaling vidéo avec cohérence temporelle