Dans Leonardo, la question n'est plus « quel outil de génération vidéo utiliser » mais « quel modèle, dans quel mode ». La plateforme regroupe plus de trente moteurs vidéo différents — Veo 3.1 de Google, Kling de Kuaishou, Hailuo de MiniMax, Seedance de ByteDance, LTX-2 de Lightricks, et une dizaine d'autres — chacun avec ses propres règles sur le son, les images de référence et le prix. Choisir le mauvais modèle, c'est payer pour une vidéo muette qu'on voulait sonore, ou attendre dix minutes une génération qu'un modèle deux fois moins cher aurait produite en quelques secondes.

Cet article détaille les deux questions à trancher avant de lancer une génération, un comparatif chiffré des coûts (sourcé, avec ses limites), et la technique qui permet de tester sans se ruiner : générer en petite définition, puis agrandir en local. Pour choisir un modèle d'image plutôt que de vidéo dans Leonardo, j'ai un comparatif dédié aux modèles image.

Florence Chatelot — Formatrice IA
À propos de l'auteure Florence Chatelot Formatrice IA & Consultante

J'accompagne des professionnels et des équipes à utiliser l'IA concrètement — sans jargon, sans gadget inutile. Mes formations et mes articles sont construits sur ce que je pratique et enseigne au quotidien.

451 apprenants · 4 730h de formation · +60 avis 5/5 Google · 23 avis 5/5 SuperProf

Les deux questions à trancher avant de choisir un modèle

Voulez-vous du son, et lequel ?

Une partie des modèles vidéo génère un son synchronisé — dialogues, bruitages, ambiance — dans la même passe que l'image. D'après la documentation de Leonardo, ces modèles incluent Veo 3.1, Kling 2.6, FLUX 3 Video, MiniMax H3 et Grok Imagine 1.5. Les autres, dont Hailuo 2.3, Seedance 1.0, Kling 2.5 Turbo et LTX-2 dans sa version de base, produisent une vidéo muette par défaut : il faut ajouter le son en post-production, ou passer par les modèles audio dédiés de Leonardo (Music, Dialogue, Sound Effects).

Le piège le plus fréquent : si votre modèle génère du son mais que vous ne décrivez pas précisément ce qu'il doit contenir, il génère « ce qu'il pense être approprié ». Pour un aboiement, un bruit de moteur ou une réplique précise, il faut le nommer explicitement dans le prompt — sans quoi le résultat est souvent trop vague ou décalé.

Image de référence, image de départ, ou image de départ et de fin ?

C'est la distinction la moins bien comprise, et elle change complètement le résultat :

Sur Leonardo, tous les modèles ne proposent pas les trois modes. Kling 2.1 Pro, par exemple, est le seul de la famille Kling 2.x à gérer le départ et la fin ; Kling Omni (O1, O3) accepte plusieurs images de référence à la fois, ce qui en fait le meilleur choix quand un personnage doit rester identique sur plusieurs plans.

Point de vigilance : si vous voulez qu'un élément précis de votre image (une plaque d'immatriculation, un logo, un visage) reste identique pendant tout le mouvement, aucun mode ne le garantit à 100 %. C'est un guidage, pas une contrainte stricte — prévoyez de vérifier chaque passage où l'élément est visible, et éventuellement de corriger en post-production.

Si votre logo ou votre personnage se déforme encore après plusieurs essais, je peux chercher avec vous le bon mode et le bon prompt en une heure de consultation, résultat obtenu ou remboursé.

Les modèles vidéo disponibles dans Leonardo, en un coup d'œil

Leonardo publie sa propre grille de lecture des modèles qu'il héberge. Voici les familles principales, condensées :

ModèlePoints fortsCas d'usage
Seedance 2.5 & 2.0Transfert de mouvement vidéo-à-vidéo, contrôle caméra précis, jusqu'à 4KÉdition de vidéo, scènes à caméra contrôlée, production quotidienne rapide
FLUX 3 VideoJusqu'à 20 s, audio natif, seul modèle capable de prolonger un clip existantRécits multi-scènes avec dialogue, extension de clips
MiniMax H32K avec audio stéréo natif (dialogue, ambiance, musique)Teasers de marque, vidéos produit, personnages qui parlent
Veo 3.1Visuels nets, forte adhérence au prompt, audio natifPublicité, vitrines produit, vidéos corporate
Kling 3.0 & 3.0 TurboJusqu'à 15 s, multi-plans (6 coupes), dialogue bilingue natifVidéos cinématiques multi-plans, storyboards automatisés
Kling Omni (O1, O3)Édition de vidéo existante, cohérence de personnage via références multiplesRetirer un objet, changer un décor, transfert de style
Kling 2.x (2.1, 2.5, 2.6)Mouvement dynamique, transitions par image ; 2.6 = seul avec audio natifAction, révélations « avant/après », plans cinématiques sonores
Seedance 1.0Récit multi-plans, cohérence de personnage entre les coupesFormats courts verticaux (9:16), contenus réseaux sociaux
Hailuo 2.3Physique complexe (danse, arts martiaux) sans distorsion ; modèle « Unlimited »Animation de personnage, contenu stylisé (anime, 3D)
LTX-24K natif, haute stabilité sur les plans longsPlans d'établissement, B-roll documentaire, diffusion professionnelle
Motion 2.0Rapide, contrôles caméra dédiés (pan, zoom, tilt) ; modèle « Unlimited »Teasers réseaux sociaux, tests rapides d'angle de caméra

Zoom sur les modèles qui comptent le plus

Veo 3.1 — le standard publicitaire

Développé par Google DeepMind. Veo 3.1 Fast sert à prototyper vite et pas cher ; Veo 3.1 (standard) livre du 1080p propre avec un son riche, pensé pour un rendu client. Les deux gèrent le départ et la fin.

Point faible documenté : l'image de fin devient un piège si elle est trop différente de l'image de départ — le modèle produit alors des artefacts de morphing en tentant de combler l'écart. Autre limite : Veo 3.1 a tendance à un rendu léché qui restitue mal les textures brutes ou « lo-fi ».

Kling — trois générations qui coexistent

Kuaishou maintient plusieurs générations en parallèle dans Leonardo, avec des usages distincts :

Hailuo 2.3 (MiniMax) — la physique complexe, sans le son

Excellent sur les mouvements continus et complexes (danse, arts martiaux, animation de personnage) sans la distorsion qu'on voit ailleurs. Sa faiblesse : un biais « 3D » marqué — sans image de départ réaliste, le rendu ressemble davantage à un jeu vidéo qu'à une prise de vue réelle. Il ne génère pas d'audio natif. C'est aussi, au moment de la rédaction, le modèle par défaut de Leonardo pour la vidéo, et l'un des modèles en génération « Unlimited » sur les plans payants (voir plus bas).

Seedance (ByteDance) — le récit multi-plans

Conçu par l'équipe Seed de ByteDance (TikTok, CapCut), entraîné sur les rythmes visuels du format court. Trois variantes sur Leonardo : Pro (1080p stable), Pro Fast (le plus économique, pensé pour les tests) et Lite (l'équilibre coût/qualité/vitesse). Seedance 1.0 est muet par défaut et gère moins bien la physique complexe que Hailuo, mais il excelle pour enchaîner plusieurs plans cohérents (plan large → gros plan) dans une seule génération verticale 9:16.

LTX-2 (Lightricks) — la résolution avant tout

Seul modèle du lineup à proposer nativement le 4K avec une image de très haute fréquence. Idéal pour les plans lents et stables (paysages, documentaire) ; nettement moins à l'aise sur l'action rapide, où il peut produire des artefacts.

Motion 2.0 — l'outil du quotidien

Pensé pour la vitesse : transformer une image fixe en boucle de 5 secondes avec un simple contrôle de caméra (pan, zoom, tilt), sans compréhension physique poussée. C'est aussi l'un des modèles en génération « Unlimited » sur les plans payants — le bon réflexe pour tester un angle de caméra avant de passer à un modèle plus coûteux.

Combien ça coûte réellement ?

Leonardo facture désormais en dollars sur son API (modèle « Pay-As-You-Go »), mais ne publie pas de grille tarifaire publique détaillée par modèle : le coût dépend de la charge GPU au moment de la génération, et seul le calculateur de prix intégré à l'application donne un chiffre exact avant de lancer une génération.

Pour comparer les modèles entre eux, l'ordre de grandeur le plus fiable et public vient de fal.ai, une API qui héberge les mêmes modèles sous-jacents et affiche ses tarifs au grand jour. Ce ne sont pas les prix facturés dans l'interface Leonardo, mais un repère relatif fiable entre modèles :

ModèleTarif indicatif (API fal.ai)Son
Veo 3.1 Lite0,03 à 0,08 $/s selon résolutionEn option (+coût)
Veo 3.1 Fast0,10 $/s sans son · 0,15 $/s avec sonEn option (+50 %)
Veo 3.1 (standard)0,20 $/s sans son · 0,40 $/s avec son (1080p)En option (+100 %)
Kling 2.5 Turbo Pro0,07 $/s (5 s = 0,35 $)Pas d'audio natif
Kling 3.0 Turbo0,112 à 0,14 $/sNatif selon variante
Kling O3 (Omni, 4K)0,42 $/sNatif
Hailuo 2.3 (standard, 768p)~0,047 à 0,056 $/sPas d'audio natif
Seedance 1.0 Pro (1080p)~0,12 $/sMuet par défaut
LTX-2 (1080p → 4K)0,06 $/s → jusqu'à 0,24 $/s en 2160pSelon variante
MiniMax H3 (480p → 4K)0,05 $/s → 0,16 $/sNatif stéréo

Ce qui saute aux yeux : l'audio double quasiment toujours le prix, et la 4K coûte 2 à 4 fois plus cher que le 1080p sur les modèles qui la proposent. Sur un test de 4 secondes avec image de référence et audio activé, comptez par exemple environ 0,60 $ avec Veo 3.1 Fast, contre 0,20 $ avec Veo 3.1 Lite — pour un rendu plus modeste mais suffisant pour valider un prompt avant de passer à la version finale.

Avant d'engager un budget de production, vous pouvez me soumettre vos plans : pendant une consultation d'une heure, nous choisissons les modèles et les réglages qui tiennent dans votre enveloppe, avec la garantie résultat obtenu ou remboursé.

Ce comparatif se limite volontairement aux modèles disponibles dans Leonardo. Pour une vue plus large incluant les abonnements grand public (Kling AI, Runway) et les modèles open source à faire tourner sur son propre GPU, j'ai détaillé cette comparaison dans un article séparé sur le vrai prix de la génération vidéo IA.

Tester sans dépenser : les modèles « Unlimited » de Leonardo

Leonardo propose quatre paliers payants (Essential à 12 $/mois, Premium à 30 $/mois, Ultimate à 60 $/mois, en plus du plan gratuit). Sur le plan Ultimate — et sur les plans Team (Starter, Growth) —, une poignée de modèles vidéo passent en génération « relaxed » illimitée : d'après la page tarifaire officielle, il s'agit actuellement de Motion 1.0, Motion 2.0, Motion 2.0 Fast, Hailuo 2.3, Hailuo 2.3 Fast et Wan 2.6. Concrètement, une fois l'abonnement payé, vous pouvez générer autant de vidéos que vous voulez avec ces modèles sans consommer de tokens — seule la file d'attente peut ralentir en cas de forte demande.

C'est le point de départ le plus économique pour tester un prompt, un mouvement ou un cadrage avant de passer à un modèle payant à l'usage comme Veo 3.1 ou Kling Omni. Leonardo recommande d'ailleurs explicitement cette approche dans sa documentation : utiliser les variantes « Fast » ou les modèles illimités pour dégrossir l'idée, puis ne passer au modèle « poids lourd » qu'une fois le prompt calé.

Générer en petite définition, puis agrandir en local : la technique qui fait économiser

Puisque le prix grimpe avec la résolution, une approche efficace consiste à générer en 720p ou même plus bas, puis à augmenter la définition après coup, en local, sur son propre ordinateur. C'est la même logique que pour les images fixes — mais avec un piège spécifique à la vidéo qu'il faut connaître avant de s'y lancer.

Point de vigilance : un upscaler d'image n'est pas fait pour la vidéo. Upscayl, que j'utilise pour agrandir des images fixes avant impression, traite chaque frame indépendamment s'il est appliqué image par image à une vidéo. Résultat : du scintillement (« flicker ») d'une frame à l'autre, chaque détail fin bougeant légèrement même quand l'image individuelle semble nette. C'est le même problème avec la plupart des outils basés sur Real-ESRGAN utilisés en mode frame-by-frame.

Pour une vidéo, il faut un outil pensé pour la cohérence temporelle — qui analyse plusieurs frames ensemble plutôt qu'une à une :

Le calcul économique reste le même que pour les images : générer une vidéo de test à bas coût pour valider le prompt et le mouvement, puis n'investir dans la définition finale (upscaling local ou régénération en haute résolution) que sur les plans retenus.

Votre vidéo agrandie scintille, ou vous hésitez entre Topaz, Video2X et l'upscaling intégré à Leonardo ?

❋ Réserver 1h de consultation ❋ Résultat obtenu ou remboursé

Quel modèle pour quel besoin ?

BesoinModèle recommandé
Tester un prompt sans dépenserHailuo 2.3, Motion 2.0 ou Wan 2.6 (Unlimited sur le plan Ultimate)
Publicité, vitrine produit, cohérence stricteVeo 3.1
Action dynamique, danse, arts martiauxHailuo 2.3 ou Kling 3.0 Turbo
Personnage identique sur plusieurs plansKling Omni (O1/O3) ou MiniMax H3
Éditer une vidéo déjà générée (retirer un objet, changer un décor)Kling Omni (O1/O3)
Plan large, documentaire, diffusion professionnelleLTX-2
Récit multi-plans pour réseaux sociaux (9:16)Seedance 1.0 ou 2.0
Clip long avec dialogue et son natifFLUX 3 Video ou MiniMax H3

Ce que j'enseigne en formation

Choisir le bon modèle vidéo fait partie des compétences que je montre en formation, parce qu'elle illustre un principe plus large : avec l'IA générative, la compétence ne consiste plus à savoir utiliser un seul outil, mais à savoir lequel choisir, dans quel mode, pour quel budget.

Dans une formation, on peut apprendre à :

Vous voulez apprendre à produire du contenu avec l'IA sans y passer vos soirées ?

❋ Se former à l'IA ❋

La bonne question à se poser

La question n'est pas : « quel est le meilleur modèle vidéo IA ? » Il n'y en a pas. La bonne question est : quel modèle correspond à ce plan précis, avec ce budget précis — et Leonardo a l'avantage de permettre de changer de moteur sans changer d'interface ni d'abonnement.

Sources utiles