Ein KI-Regisseur, der Reels schneidet
aus den Clips, die Sie an einen Bot senden
Eine Prototyp-Pipeline: Ein Telegram-Bot sammelt Fotos und Videos, Sprache wird lokal mit Wort-Zeitstempeln transkribiert, Szenen und beste Momente werden mit einem Vision-Modell erkannt, ein KI-Regisseur auf Basis von Claude schreibt eine exakte JSON-Timeline (Hook in den ersten 1,5 Sekunden, Schnitte auf die Beats, Karaoke-Untertitel, Übergänge), und ffmpeg rendert mit Untertiteln, Ken-Burns-Effekt auf Fotos und Music-Ducking. Überarbeitungen über Inline-Buttons, ohne die Quellen neu zu analysieren.
Was es zeigt
Das Muster hinter unseren Content-Agenten: Ein Modell entscheidet, deterministische Tools führen aus. Der Regisseur schreibt eine Timeline als Daten; ffmpeg übernimmt den Schnitt; die Beats stammen aus einer Audioanalyse, nicht aus Vermutungen. Überarbeitungen ändern die Timeline, sodass die aufwendige Analyse nur einmal läuft.