AI Content Factory
Pipeline automatisée de production vidéo basée sur plusieurs modèles d'IA générative orchestrés.
Du briefing aux clips vidéo finis : des modèles d'IA spécialisés pour la génération de texte, d'images et de vidéo sont réunis en un processus de production automatisé et pilotable.
- Défi technique
- Plusieurs modèles d'IA générative spécialisés devaient être orchestrés en un processus de production vidéo automatisé et reproductible – plutôt que d'être actionnés individuellement et manuellement.
- Architecture
- Une histoire en allemand est décomposée par un LLM (Ollama qwen2.5vl) en un storyboard de trois clips ; un modèle d'image (Qwen-Image-Edit) produit les images de départ et de fin avec une continuité parfaite, un modèle first-last-frame-to-video (Wan2.1-FLF2V-14B) génère les clips sur une instance GPU.
- Défis d'ingénierie
- Des personnages cohérents d'un clip à l'autre (image de fin N = image de départ N+1), un traitement asynchrone malgré de longues durées d'exécution de LLM, une exploitation GPU en scale-to-zero et l'orchestration via SQS plutôt que par des appels API synchrones.
- Compétences démontrées
- IA générative, orchestration de modèles, automatisation de workflows et pipelines de production avec modèle de jobs asynchrone et exploitation GPU.
L’AI Content Factory (Storyboard Generator) est une étude de cas d’ingénierie Riegel Systems dans le domaine de l’IA générative. L’idée centrale : plusieurs modèles d’IA spécialisés ne sont pas « actionnés » individuellement, mais orchestrés en une pipeline de production automatisée.
La pipeline
- Briefing
- Storyboard
- Scene Planning
- Start Image
- End Image
- Video Prompt
- Image-to-Video
- Final Clips
Concrètement mis en œuvre
À partir d’une histoire en allemand naît automatiquement un storyboard de trois clips de 6 secondes :
- Story → Storyboard : un LLM (Ollama
qwen2.5vl) décompose l’histoire en trois scènes et génère pour chaque clip un prompt d’image de départ, un prompt d’image de fin, un prompt de mouvement et un prompt négatif – sous forme de JSON strict validé par schéma. - Génération d’images : un modèle de retouche d’image (
Qwen-Image-Edit-2511, Apache-2.0) produit les quatre images avec une continuité parfaite – l’image de fin d’un clip est en même temps l’image de départ du suivant. - Image-to-Video : un modèle first-last-frame-to-video (
Wan2.1-FLF2V-14B) génère les clips finaux à partir de l’image de départ, de l’image de fin et du prompt, sur une instance GPU (L40S) avec scale-to-zero. - Workflow de validation : les aperçus sont vérifiés et édités dans une interface d’administration avant le déclenchement des jobs vidéo.
Points clés d’ingénierie
- Model Orchestration : chaque modèle prend en charge la tâche pour laquelle il est le mieux adapté – analyse de texte, retouche d’image, génération vidéo.
- Modèle de jobs asynchrone : les longues durées d’exécution des LLM et des GPU sont découplées via SQS au lieu d’être contraintes par des fenêtres de timeout API restrictives.
- Prompt Generation : des prompts précis, générés automatiquement, pilotent les modèles de manière déterministe plutôt que manuelle.
Message clé
Les systèmes d’IA générative prêts pour la production relèvent de l’intégration système : normaliser les entrées, valider les sorties, gérer les échecs et surveiller les coûts. Le Storyboard Generator montre comment des modèles individuels deviennent un processus de production fiable et reproductible.
Technologies & concepts
Un projet d'ingénierie similaire ?
Si votre projet requiert une profondeur technique comparable, nous discutons faisabilité, architecture et effort – concrètement plutôt qu'en format pitch.
