A Anthropic liberou oficialmente nesta semana que usuários pagantes do Claude executem conversas por voz nos modelos Opus e Sonnet. Esta atualização também introduz conectores do aplicativo do Claude no modo de voz, permitindo que os usuários acessem Gmail, Google Agenda, Slack, Canva e Notion por meio de comandos de voz. O suporte a idiomas foi ampliado para 11 opções, incluindo inglês, francês e outros.
O modo de voz do Claude sai do Haiku e chega ao Opus/Sonnet
De acordo com os relatos da TechCrunch e do 9to5Mac, o ponto central desta atualização é a elevação do nível de modelo em que o modo de voz consegue ser executado. Antes, todas as solicitações de voz eram processadas pelo Claude Haiku 4.5 (o modelo mais leve e rápido da Anthropic) para manter tempos de resposta baixos; já a nova versão permite que usuários pagantes escolham o modo de voz Opus ou Sonnet para lidar com tarefas mais complexas.
O TestingCatalog, em um anúncio antes da publicação oficial, descobriu que o seletor de modo na interface existia como um controle visual no modo de voz havia cerca de três semanas, mas somente nesta semana a escolha entre Opus ou Sonnet realmente passou a alterar o roteamento do modelo subjacente. As contas gratuitas ainda ficam limitadas ao Haiku e a um aplicativo conectado, mas ainda é possível fazer trocas de voz em todos os idiomas suportados.
Conectores de aplicativo entram no modo de voz: cinco ferramentas com suporte a consultas e ações por voz
De acordo com a TechCrunch e a Engadget, agora o modo de voz do Claude pode acessar os seguintes cinco aplicativos conectados:
Gmail: escrever ou consultar e-mails com comandos de voz
Google Agenda: mover ou consultar reuniões por voz
Slack: acessar o contexto das mensagens do Slack
Canva: operações em documentos relacionados
Notion: criar documentos do Notion com comandos de voz
Depois que os usuários concedem permissões, o modo de voz pode obter informações de contexto a partir dos aplicativos já conectados. A Anthropic afirma que o foco desta atualização está em “análises inteligentes e acesso a ferramentas”, com tarefas-alvo incluindo ensaiar propostas para clientes, obter feedback sobre maneiras de se comunicar e conduzir pesquisas de produto em voz alta. A TechCrunch aponta que, em comparação, o modo de voz após a atualização da OpenAI mudou o estilo da conversa, mas ainda não consegue concluir tarefas usando ferramentas.
Revezamento na fala do Claude vs GPT-Live ouvindo ao mesmo tempo
Segundo a explicação de um representante da Anthropic à TechCrunch, o modo de voz do Claude usa um “sistema de turnos”: primeiro ouve, depois pensa e então fala; o GPT-Live, por sua vez, oferece suporte para ouvir e falar simultaneamente.
A TechCrunch também destacou que a atualização desta versão da Anthropic não alterou o modelo de voz subjacente, nem detalhou completamente os aspectos técnicos do “stack” de voz. De acordo com testes do TestingCatalog, o Claude ainda gera voz usando tecnologia de texto-para-voz, e a saída de áudio vem do ElevenLabs, mas a função de interrupção do processamento opera normalmente.
Perguntas frequentes
Quais modelos são suportados após a atualização do modo de voz do Claude?
De acordo com o comunicado da Anthropic, usuários pagantes agora podem escolher Opus, Sonnet ou Haiku no modo de voz, com um seletor de modo integrado à interface; contas gratuitas ainda ficam limitadas ao Haiku e a um aplicativo conectado.
Quais conectores de aplicativos o modo de voz do Claude suporta?
De acordo com os relatos da TechCrunch e da Engadget, o modo de voz agora pode acessar Gmail, Google Agenda, Slack, Canva e Notion, permitindo que usuários executem ações nesses aplicativos por meio de comandos de voz.
Qual a diferença de arquitetura entre o modo de voz do Claude e o GPT-Live?
De acordo com a explicação do representante da Anthropic, o Claude adota um “sistema de turnos para falar” (ouve primeiro), enquanto o GPT-Live suporta ouvir e falar simultaneamente; a TechCrunch aponta que a atualização do modo de voz da OpenAI mudou o estilo da conversa, mas ainda não consegue concluir tarefas usando ferramentas por voz.