Alibaba acaba de presentar Wan Streamer, un modelo de IA que ve, escucha y habla contigo en tiempo real, con video sincronizado.
A diferencia del modo voz que conocíamos, donde el audio se transcribe, se procesa como texto y luego se genera una respuesta por separado, Wan Streamer hace todo en un solo modelo: percepción, razonamiento y generación de audio y video al mismo tiempo.
Los números: alrededor de 200 milisegundos de latencia del lado del modelo, y unos 550 milisegundos de latencia total con la red incluida. Eso es casi instantáneo.
El sistema puede notar cuando lo interrumpes mientras habla y ajustarse al momento, como haría una persona real en una videollamada. También genera gestos, parpadeo y lenguaje corporal de forma continua, no solo cuando está hablando.
Por ahora es la versión v0.1, en etapa de investigación, con demos en baja resolución (192p) y sin pesos públicos todavía. Pero la dirección es clara: la frontera ya no es solo texto o voz, es presencia visual en ti...
Not seeing views yet? Check back later!
Suggested Credits
Tags, Events, and Projects