Claude peut faire des vidéos. Le consultant IA Nicolas Chapuis l'a montré récemment sur LinkedIn : il a demandé à Claude Opus 5.5 de produire « une vidéo éducative en JavaScript sur le sujet de son choix ». Le modèle a choisi le sujet, écrit le code, vérifié les calculs mathématiques, puis posé une voix off avec les voix de synthèse intégrées à macOS. La voix étant un peu robotique, il a refait à sa demande une version uniquement musicale, avec une musique elle aussi générée par le code. Le tout a pris une dizaine de minutes.
Le même jour, la newsletter Optimia de Louis Graffeuil décrivait un tout autre résultat : un short vertical « face caméra » de 37 secondes, avec avatar, voix clonée, sous-titres animés, B-roll et 37 bruitages, monté par Claude Code pour 0,37 $. Deux résultats très différents, mais un même mécanisme de fond. C'est ce mécanisme que je détaille ici, avec les sources pour aller plus loin.
Le principe : une vidéo, c'est du code qui dessine 30 images par seconde
Un modèle de langage comme Claude produit du texte, et le code est du texte. Une vidéo, de son côté, n'est qu'une suite d'images fixes (25 ou 30 par seconde) accompagnée d'une piste audio. Il suffit donc que Claude écrive un programme capable de dessiner l'image exacte correspondant à n'importe quel instant t de la vidéo : à 12,40 secondes, la graine de pissenlit est ici, le titre est là, la courbe a cette forme.
Le reste est mécanique, et repose sur des outils gratuits et éprouvés :
- Une scène : un fichier HTML avec un
<canvas>ou du SVG, que Claude écrit et qui dessine l'image à l'instant t. - Une capture image par image : un navigateur sans interface (Chrome piloté par Playwright ou Puppeteer) avance le temps image par image et enregistre chaque image en PNG. Une vidéo de 30 secondes à 30 images par seconde, ce sont 900 captures.
- Un assemblage : FFmpeg, l'outil en ligne de commande de référence pour la vidéo, colle les images en MP4 et y ajoute la piste son.
Le point clé, détaillé dans un guide publié sur Hugging Face fin septembre 2026 : chaque pixel doit dépendre uniquement du temps t. Pas d'animation qui tourne « en direct » ni de hasard non maîtrisé, sinon deux rendus de la même scène donnent deux vidéos différentes, et une machine lente saute des images. C'est ce qui rend le montage reproductible : on corrige une ligne de code, on relance, on obtient exactement la même vidéo avec la correction.
Quand Claude « fait une vidéo », il écrit donc un programme d'animation. C'est aussi pour cela qu'il peut « vérifier les maths » d'une vidéo éducative : la courbe affichée est calculée par le code, qu'il peut exécuter et tester avant de lancer le rendu.
Et le son ? Voix de synthèse et musique écrite en code
La voix off : les voix du système, puis les voix clonées
Sur Mac, la commande say existe depuis des années : elle lit un texte avec les voix installées dans macOS et peut l'enregistrer dans un fichier audio (say -v Thomas -o voix.aiff "Bonjour"). C'est très probablement ce qu'a utilisé Claude dans l'exemple de Nicolas Chapuis : gratuit, local, immédiat, mais avec un rendu robotique. Windows propose l'équivalent via ses voix système.
Pour une voix naturelle, il faut passer par un service de synthèse vocale comme ElevenLabs, qui permet aussi de cloner sa propre voix. Claude Code appelle alors l'API du service, récupère un MP3 et le place dans la timeline.
La musique : des oscillateurs programmés note par note
Générer une musique « en code » signifie que Claude écrit la partition et le synthétiseur à la fois : des oscillateurs (sinusoïdes, signaux carrés…) dont il règle la fréquence de chaque note, la durée, le volume et l'enveloppe. Dans un navigateur, l'API Web Audio fournit pour cela un OfflineAudioContext qui calcule le son plus vite que le temps réel, sans le jouer, pour l'exporter ensuite en fichier WAV. En Python, quelques lignes suffisent pour calculer les échantillons et les écrire dans un WAV.
Le résultat ressemble plus à une musique de jeu vidéo rétro ou à une nappe d'ambiance qu'à un morceau produit en studio, mais il est libre de droits, synchronisé à l'image près avec l'animation et modifiable par simple prompt (« plus lent », « en mineur », « coupe la basse à 20 secondes »).
Les quatre façons de faire une vidéo avec Claude
Option 1 : tout en code, sans outil spécialisé
C'est le cas de l'exemple LinkedIn. Claude écrit la scène HTML, le script de capture, la musique et la commande FFmpeg. Il faut seulement que Node.js, un navigateur et FFmpeg soient installés sur la machine, ce que Claude Code sait vérifier et installer lui-même. Idéal pour les vidéos explicatives, les animations de données, les visuels abstraits et les petites démonstrations.
Option 2 : un framework vidéo piloté par Claude Code
Plutôt que de tout réinventer, Claude peut s'appuyer sur un framework dédié qui gère la capture, le timing et l'export. Trois sont très utilisés en 2026 :
- Remotion : des vidéos écrites comme des composants React. Remotion publie ses propres skills pour agents (
npx skills add remotion-dev/skills), qui apprennent à Claude les bonnes pratiques du framework. Gratuit pour les particuliers et les entreprises jusqu'à 3 salariés ; au-delà, une licence entreprise est requise. - HyperFrames : le framework open source (licence Apache 2.0) de HeyGen, pensé dès le départ pour les agents IA. On écrit du HTML, on obtient une vidéo. Il s'installe comme plugin Claude Code et inclut des briques prêtes à l'emploi : sous-titres, mixage audio, voix de synthèse, transitions.
- Manim : la bibliothèque Python derrière les vidéos de mathématiques de la chaîne 3Blue1Brown. Le meilleur choix pour des explications scientifiques : équations, graphes, géométrie, démonstrations animées.
Option 3 : le pipeline hybride avec avatar, voix clonée et B-roll
C'est le workflow présenté par la newsletter Optimia. Claude Code y joue le rôle de chef de projet et de monteur, en appelant plusieurs services spécialisés :
- Avatar : on se filme une fois (30 secondes minimum, 2 minutes conseillées) sur HeyGen pour créer son double numérique.
- Voix : clone de sa voix sur ElevenLabs. Claude rédige le script, ElevenLabs le lit et renvoie un MP3.
- Synchronisation : le MP3 est envoyé à HeyGen, qui fait bouger les lèvres de l'avatar sur la voix.
- Montage : Claude transcrit l'audio au mot près, rédige un plan d'habillage (quel titre, quel sous-titre, quel plan de coupe à chaque instant), soumet les décisions à valider, puis monte avec HyperFrames. Les plans de coupe (B-roll) sont générés par un modèle vidéo via fal.ai.
- Vérification : Claude exporte, prend des captures de son propre rendu, les examine, corrige et relance, de façon autonome. Sur le short de la newsletter, il a repéré tout seul que le titre n'apparaissait pas sur la première image.
Coût annoncé : 0,37 $ pour le short (dont 0,36 $ de B-roll), avec une préparation initiale à prévoir pour créer l'avatar et cloner la voix. Point faible relevé par l'auteur : la qualité de l'avatar sur l'offre gratuite de HeyGen (720p avec filigrane, perte de netteté au recadrage vertical).
C'est l'option où les blocages sont les plus fréquents, car chaque service a sa clé d'API, ses formats et ses quotas. Si l'enchaînement HeyGen, ElevenLabs et fal.ai s'arrête à une étape, je peux vous aider à le remettre en route en une heure de consultation, résultat obtenu ou remboursé.
Option 4 : Claude comme scénariste pour les modèles de génération vidéo
Pour des images filmées réalistes (personnages, paysages, mouvements de caméra), le code ne suffit pas : il faut un modèle de génération vidéo comme Veo, Kling ou Seedance. Claude n'en génère pas lui-même, mais il est très efficace pour découper un scénario en plans, rédiger les prompts de chaque plan et assembler les clips obtenus avec FFmpeg. J'ai comparé ces modèles dans deux articles : le comparatif des prix de la génération vidéo IA et quel modèle vidéo choisir dans Leonardo.
Comment Claude vérifie un montage qu'il ne peut pas regarder
Claude ne lit pas de fichier vidéo, mais il lit des images. La boucle de vérification exploite cette capacité : après le rendu, il extrait quelques images clés avec FFmpeg (le début, chaque transition, la fin), les regarde, compare avec ce qu'il voulait obtenir, puis corrige le code. Pour le son, il s'appuie sur la transcription horodatée et sur les durées calculées par son propre code.
C'est aussi pour cela que tout se passe dans Claude Code (ou l'application de bureau) plutôt que dans le chat classique : une vidéo est une arborescence de fichiers (scènes, MP3, transcription, plan de montage, plans de coupe, rendu) et d'outils à lancer sur votre ordinateur. Le chat sait écrire le code ; Claude Code sait aussi l'exécuter, regarder le résultat et recommencer.
Quelle méthode choisir ?
| Méthode | Idéal pour | Coût | Limite principale |
|---|---|---|---|
| Tout en code (HTML + FFmpeg) | Vidéo explicative, animation de données, visuel abstrait | Abonnement Claude uniquement | Voix système robotique, rendu « motion design » uniquement |
| Framework (Remotion, HyperFrames, Manim) | Vidéos récurrentes, charte graphique, sous-titres, formats réseaux sociaux | Gratuit (licence Remotion payante au-delà de 3 salariés) | Installation initiale, à faire dans Claude Code |
| Pipeline hybride avec avatar | Shorts face caméra sans se filmer à chaque fois | Quelques centimes à quelques dollars par vidéo | Avatar perfectible, droits et mention IA obligatoires |
| Modèles de génération vidéo | Images réalistes, clips filmés | Selon le modèle, à la seconde générée | Cohérence entre les plans, coût des essais |
Essayer vous-même : un premier prompt pour Claude Code
Pour un premier essai sans rien installer à la main, ouvrez Claude Code dans un dossier vide et copiez cette instruction. Adaptez le sujet entre crochets.
Crée une vidéo MP4 de 30 secondes, format 16:9 en 1920x1080 à 30 images par seconde, qui explique [le sujet de ton choix] de façon visuelle.
1. Écris une scène HTML en canvas dont chaque image dépend uniquement du temps t (fonction seek(t), aucun hasard non initialisé, aucune animation en temps réel).
2. Vérifie que Node.js, Playwright et FFmpeg sont installés, et installe ce qui manque après m'avoir demandé.
3. Capture chaque image, puis assemble le MP4 avec FFmpeg.
4. Compose une musique d'ambiance douce en code, exportée en WAV, et ajoute-la à la vidéo.
5. Avant de me rendre la vidéo, extrais 6 images clés avec FFmpeg, regarde-les et corrige tout problème de lisibilité ou de cadrage.
Une fois ce premier rendu obtenu, demandez des modifications comme vous le feriez à un monteur : « le titre reste trop peu de temps », « mets la palette en noir et jaune », « passe en 9:16 pour LinkedIn ». Chaque retour se traduit par une modification du code et un nouveau rendu.
Playwright refuse de s'installer, FFmpeg renvoie une erreur ou le rendu saute des images ?
❋ Réserver 1h de consultation ❋ Résultat obtenu ou rembourséLimites et points de vigilance
- Le goût reste humain. Sans direction artistique, sans référence visuelle ni idée claire, on obtient vite une vidéo générique. Les démonstrations spectaculaires qui circulent reposent presque toujours sur une préparation en amont (un skill, une charte, un bon script).
- Erreurs factuelles possibles. Une vidéo explicative générée peut contenir une erreur, même si les calculs sont exécutés. Relisez le script avant le rendu final.
- Droits sur la voix et le visage. Cloner la voix ou l'image d'une autre personne exige son accord écrit, précis sur le support, l'objectif et la durée.
- Mention du contenu généré. YouTube, TikTok et Instagram demandent de signaler les contenus réalistes générés par IA, et le règlement européen sur l'IA (article 50) impose d'indiquer qu'un hypertrucage (deepfake) a été généré ou manipulé artificiellement.
- Licences des outils. HyperFrames et Manim sont libres ; Remotion devient payant pour les entreprises de plus de 3 salariés. Vérifiez aussi les droits des musiques et bruitages que vous n'avez pas générés vous-même.
Ce que ça change pour les professionnels
Savoir monter une vidéo n'est plus la barrière principale. Ce qui compte désormais, c'est de savoir ce que vous voulez raconter et de le décrire assez précisément pour qu'une machine l'exécute : un script, un rythme, une palette, des exemples de ce qui vous plaît. Une vidéo explicative pour un client, une animation de chiffres pour LinkedIn ou un tutoriel interne deviennent accessibles à une petite structure sans logiciel de montage, à condition d'accepter une heure de mise en place et quelques allers-retours.
Pour choisir la méthode adaptée à vos vidéos et poser les bases (script, charte, premier rendu) avec une professionnelle, réservez une consultation d'une heure : résultat obtenu ou remboursé.
Vous voulez apprendre à piloter Claude Code sur ce type de projet ?
❋ Se former à l'IA ❋Sources
- Nicolas Chapuis, consultant IA et produit : post LinkedIn « J'ai demandé à Opus 5.5 de faire une vidéo éducative en Javascript » (septembre 2026)
- Louis Graffeuil, Optimia : « Création et montage vidéo de A à Z avec l'IA : avatar, voix, montage, B-roll » (2 octobre 2026)
- Hugging Face : How to Make Videos with Claude Opus 5.5, a Deterministic Render Pipeline (27 septembre 2026, en anglais)
- HyperFrames (HeyGen) : dépôt GitHub et documentation
- Remotion : documentation des Agent Skills et licence
- Manim Skill pour Claude Code
- Awesome Claude Video Skills : 180 outils open source classés par usage
- Commande say de macOS : synthèse vocale en ligne de commande
- MDN : OfflineAudioContext (API Web Audio)
- Règlement (UE) 2024/1689 sur l'intelligence artificielle, article 50