Black Forest Labs ha rilasciato FLUX 3 e FLUX-mimic giovedì, affiancando un nuovo modello di fondazione multimodale al primo modello del laboratorio tedesco costruito per controllare macchine fisiche. È una svolta netta per un’azienda nota soprattutto per i modelli di immagini alla base di una quota significativa degli strumenti generativi europei.
FLUX 3
La capacità principale è il video con audio nativo fino a 20 secondi in una singola generazione — non un passaggio video seguito da un passaggio separato per la colonna sonora. Gestisce inoltre dialoghi multilingue e keyframe-to-video. Valutazioni preliminari di preferenza pubblicate dal laboratorio lo collocano al 77% contro Runway Gen-4.5 e al 93% contro Luma Ray 3.2. I pesi aperti per una variante FLUX 3 Dev sono previsti una volta concluso l’accesso anticipato.
FLUX-mimic
Il modello per la robotica è un sistema video-action — prevede ciò che dovrebbe accadere in seguito in una scena ed emette le azioni per farlo accadere. È stato sviluppato con Mimic Robotics, un’azienda di manipolazione con sede a Zurigo, ed è in fase di test di implementazione in produzione presso Audi. Questo impiego industriale nominato è l’elemento che lo distingue dalla maggior parte degli annunci sull’IA fisica.
Perché un laboratorio video si occupa di robot
La scommessa è che un modello addestrato a prevedere il fotogramma successivo del mondo fisico abbia già imparato gran parte di ciò di cui una policy robotica ha bisogno — permanenza degli oggetti, contatto, conseguenza. Generazione video e controllo robotico finiscono per essere lo stesso problema di previsione con teste di uscita diverse. È la stessa scommessa che Google e Nvidia stanno facendo con i world model, arrivando però dalla direzione opposta.
La dimensione europea
Black Forest Labs è l’ingresso non statunitense più evidente nella corsa all’IA fisica, e il suo storico in termini di pesi aperti conta: i modelli immagine FLUX sono diventati infrastruttura predefinita anche perché i pesi sono stati pubblicati. Se FLUX 3 Dev arriverà alle stesse condizioni determinerà se questo si ripeterà per video e controllo.
