ByteDance Seed apresenta SeedRealtime, modelo de linguagem com interação simultânea de áudio, vídeo e texto
A equipe Seed da ByteDance apresentou oficialmente o SeedRealtime, um modelo de linguagem de grande porte nativo com capacidade full-duplex áudio-visual. O modelo se diferencia por unir áudio, vídeo e texto em uma arquitetura única e integrada, em vez de encadear módulos separados para cada tarefa. A proposta é permitir interações em tempo real a partir de fluxos multimodais contínuos, nos quais o sistema assiste, ouve e fala de forma simultânea, sem depender de trocas isoladas de informação.
O modelo foi posicionado pela empresa como mais um passo rumo à interação omni-modal, termo usado para descrever sistemas capazes de processar simultaneamente diferentes formas de informação, como imagens, sons e texto. Segundo a ByteDance, o SeedRealtime alcança três avanços principais: compreensão conjunta de áudio e vídeo, capacidade de interação proativa e temporização natural de conversa. A arquitetura tradicional em cascata, que combina módulos independentes de reconhecimento de fala automática, modelo de visão e linguagem e síntese de voz, costuma adicionar latência e provocar perda de informação entre as etapas. O SeedRealtime resolve esse problema ao executar percepção, compreensão, tomada de decisão e expressão em paralelo dentro de um único modelo de ponta a ponta.
Outro diferencial está na forma como o sistema decide quando falar. Em pilhas de voz em tempo real, um detector externo de atividade de voz geralmente controla os turnos de fala, o que pode gerar atrasos ou interrupções inadequadas. No SeedRealtime, essa lógica foi movida para dentro do próprio modelo, que passa a gerenciar autonomamente o momento de iniciar uma resposta. Segundo a avaliação interna conduzida pela própria ByteDance, os problemas de ritmo em conversas com áudio e vídeo foram reduzidos pela metade em comparação com sistemas em cascata, embora a empresa não tenha divulgado dados de latência nem benchmarks detalhados.
O SeedRealtime já está disponível para usuários finais dentro do aplicativo Doubao, o assistente de consumo da ByteDance. No entanto, para desenvolvedores externos, o cenário é diferente. A empresa não publicou relatório técnico, não informou o número de parâmetros do modelo, não disponibilizou os pesos abertos e não anunciou endpoints de acesso por meio das plataformas Volcano Engine ou BytePlus. Isso significa que, por enquanto, equipes de terceiros não conseguem integrar o modelo diretamente em seus próprios produtos.
Para demonstrar o funcionamento do SeedRealtime, a ByteDance publicou sete cenários de uso, dos quais quatro se destacam por evidenciar capacidades centrais do modelo. No primeiro, chamado de vinculação de identidade entre modalidades, o sistema participa de um jantar com várias pessoas e ruído de fundo. À medida que o usuário apresenta cada convidado, o modelo associa nomes a rostos pela aparência e mantém a voz de cada pessoa vinculada à sua identidade durante toda a conversa, conseguindo atribuir preferências conflitantes ao interlocutor correto antes de sugerir um plano.
O segundo cenário mostra a fala proativa a partir de uma instrução prévia. Em um museu em Hebei, o usuário pede para ser avisado quando um determinado suporte de tela de bronze aparecer. Enquanto a câmera continua se movendo, o modelo observa o ambiente e, sem novo comando, avisa quando o objeto entra em quadro. O mesmo comportamento se repete na leitura de um artigo acadêmico sobre redes neurais convolucionais residuais, popularmente conhecidas como ResNet: o modelo acompanha páginas sendo viradas rapidamente, identifica a seção de implementação, para por conta própria e lê em voz alta os valores de taxa de aprendizado, momentum e decaimento de peso.
No terceiro cenário, o modelo demonstra correção a partir do estado visual, sem que o usuário faça uma pergunta. Ao observar o preparo de um café espresso, o sistema interrompe quando grãos inteiros são colocados no porta-filtro, avalia a cor e o volume da crema e sugere encurtar a extração em dois a três segundos. O quarto cenário apresenta supressão de interferência e uso de memória fora da tela. Em um aeroporto, conversas paralelas sobre voos não disparam respostas. Quando o usuário realmente faz uma pergunta, o modelo responde com base em informações do painel de embarque que já tinham saído da tela e busca online a localização da esteira de bagagens.
No conjunto, o SeedRealtime representa uma mudança de referência para qualquer equipe que desenvolva produtos de voz com câmera em tempo real. A ideia validada de unir todas as etapas em um único modelo e mover o controle de turnos para dentro dele já está em produção em larga escala no Doubao, ainda que os recursos técnicos permaneçam restritos ao ecossistema da ByteDance por enquanto.