facebook pixel
Alibaba acaba de presentar Wan Streamer, un modelo de IA que ve, escucha y habla contigo en tiempo real, con video sincronizado. A diferencia del modo voz que conocíamos, donde el audio se transcribe, se procesa como texto y luego se genera una respuesta por separado, Wan Streamer hace todo en un solo modelo: percepción, razonamiento y generación de audio y video al mismo tiempo. Los números: alrededor de 200 milisegundos de latencia del lado del modelo, y unos 550 milisegundos de latencia total con la red incluida. Eso es casi instantáneo. El sistema puede notar cuando lo interrumpes mientras habla y ajustarse al momento, como haría una persona real en una videollamada. También genera gestos, parpadeo y lenguaje corporal de forma continua, no solo cuando está hablando. Por ahora es la versión v0.1, en etapa de investigación, con demos en baja resolución (192p) y sin pesos públicos todavía. Pero la dirección es clara: la frontera ya no es solo texto o voz, es presencia visual en ti...

 105

 5

Not seeing views yet? Check back later!
    Suggested Credits
    Tags, Events, and Projects