O mercado de reconhecimento de fala aberto deixou de girar em torno do Whisper em 2026; Cohere Transcribe, Granite Speech 4.1 e Qwen3-ASR agora disputam liderança em precisão, latência e cobertura multilíngue.
O fim da supremacia do Whisper
O ecossistema de reconhecimento automático de fala (ASR) deixou de depender de um único modelo padrão. Em março de 2026, segundo a MarkTechPost, a Cohere lançou o Transcribe, modelo de 2 bilhões de parâmetros sob licença Apache 2.0, que alcançou 5,42% de taxa de erro de palavras (WER) no Open ASR Leaderboard da Hugging Face. Cinco semanas depois, a IBM respondeu com o Granite Speech 4.1 2B, marcando 5,33%. Desde então, o ARK-ASR-3B e o MOSS-Transcribe-preview-2B registraram números ainda menores.
Precisão no topo já quase não diferencia
A diferença entre as primeiras colocações do ranking de precisão é inferior a um ponto percentual de WER, o que muda o critério de decisão. De acordo com a publicação, licença, cobertura de idiomas, suporte a streaming e custo por hora de áudio passaram a pesar mais do que a posição na tabela.
A comparação direta de médias também exige cautela. O 5,42% da Cohere considera oito conjuntos de teste em inglês, incluindo o TED-LIUM. Já o ARK-ASR-3B é avaliado em sete conjuntos, sem o TED-LIUM — uma das bases mais fáceis. Recalculando a Cohere sobre os mesmos sete conjuntos, a média sobe para 5,84%; o Granite Speech 4.1 2B passa de 5,33% para 5,65%. Some-se a isso o fato de o cartão do MOSS-Transcribe-preview-2B indicar que o modelo foi ajustado por aprendizado por reforço nos próprios splits do leaderboard, prática que mede o benchmark mais do que a capacidade real.
Os modelos de melhor pontuação
A Cohere Transcribe, 2B, Apache 2.0, cobre 14 idiomas e foi baixada mais de 620 mil vezes no mês anterior à publicação, com suporte de execução em transformers, vLLM, mlx-audio para Apple Silicon, além de uma porta em Rust e build em WebGPU. Em avaliação humana da própria Cohere, anotadores treinados pontuaram as transcrições em preservação de sentido, alucinações e entidades nomeadas, e o modelo teve taxa média de vitória de 61% — 78% contra o IBM Granite 4.0 1B Speech e 64% contra o Whisper large-v3. O cartão do modelo ressalva, porém, a ausência de detecção automática de idioma, de timestamps e de diarização, e a tendência de transcrever silêncios — a Cohere recomenda pré-processar o áudio com um VAD ou noise gate. O repositório também exige preenchimento de dados de contato apesar da licença aberta.
O Granite Speech 4.1 2B, da IBM, 2B, Apache 2.0, trabalha com seis idiomas para ASR e oferece tradução de fala bidirecional, biasing por lista de palavras-chave, pontuação e truecasing (incluindo capitalização de substantivos em alemão). Foi treinado em 174 mil horas de áudio e alcança RTFx 231,29. Variantes -plus acrescentam diarização e timestamps por palavra; a variante -nar é discutida adiante.
O Canary-Qwen-2.5B, 2,5B, CC-BY-4.0, é um modelo apenas para inglês que combina um encoder FastConformer com o decoder Qwen3-1.7B e opera em dois modos — transcrição pura ou modo LLM, no qual o decoder resume e responde perguntas sobre a transcrição. Marca 5,63% de WER com RTFx 418. O AMI foi superamostrado para cerca de 15% dos dados de treino, o que pende a saída para transcrições com disfluências preservadas — útil em contextos jurídicos, ruidoso para notas de reunião.
O Qwen3-ASR-1.7B, Apache 2.0, cobre 52 idiomas e dialetos — 30 idiomas mais 22 dialetos chineses — com WER de 5,76%. Acompanha toolkit de inferência e modelo separado de forced-alignment para timestamps em 11 idiomas. Para projetos que tocam mandarim ou fala regional chinesa, é o ponto de partida óbvio.
Throughput virou o fator de custo
A precisão no topo do campo varia em cerca de um ponto de WER; o throughput varia em mais de uma ordem de grandeza. Conforme a MarkTechPost, throughput costuma definir o tamanho da fatura.
O Parakeet TDT 0.6B v3, 0,6B, CC-BY-4.0, lidera entre modelos multilíngues abertos em RTFx 3332,74 em 25 idiomas europeus, com identificação automática de idioma e capacidade de processar até 24 minutos em uma única passada em uma A100 80GB. O custo é 6,32% de WER — cerca de um ponto acima do Granite 4.1 2B, mas com cerca de quatorze vezes mais áudio por segundo de GPU.
O Granite Speech 4.1 2B-NAR é não autorregressivo: edita uma hipótese de CTC em uma única passada usando um LLM bidirecional, chegando a RTFx ~1820 em uma H100 com batch size 128. A troca é a perda de japonês, tradução de fala e biasing por palavras-chave.
O Qwen3-ASR-0.6B mantém os 52 idiomas e alcança throughput de 2000× em concorrência 128.
Streaming e voz em tempo real
Para agentes de voz, a latência percebida depende mais da detecção de fim de fala do que da velocidade bruta de transcrição.
O Voxtral Mini 4B Realtime 2602, Apache 2.0, 13 idiomas, combina um modelo de linguagem de 3,4B com um encoder causal de áudio de 970M, ambos com atenção deslizante, permitindo streaming teoricamente ilimitado. O atraso de transcrição é configurável em passos de 80 ms, de 80 ms a 1200 ms, mais uma opção isolada de 2400 ms; a Mistral recomenda 480 ms como ponto de equilíbrio e afirma que, nesse ajuste, o modelo iguala os melhores modelos offline abertos. Roda em uma única GPU de 16 GB e teve suporte de API Realtime via vLLM no dia do lançamento.
O Kyutai STT, CC-BY-4.0, aparece em duas versões: um modelo de cerca de 1B para inglês e francês com atraso de 0,5 s e VAD semântico embutido, e um modelo de 2,6B só para inglês com 2,5 s de atraso. Uma H100 atende 400 streams simultâneas em tempo real.
Multilinguismo em escalas muito diferentes
O Omnilingual ASR da Meta, Apache 2.0 nos modelos e CC-BY no corpus, não compete por WER. Cobre mais de 1.600 idiomas de forma nativa e estende para mais de 5.400 via aprendizado em contexto zero-shot, apoiado em um encoder wav2vec 2.0 de 7B pré-treinado em cerca de 4,3 milhões de horas. A versão LLM-ASR 7B atinge taxa de erro de caracteres abaixo de 10% em 78% dos idiomas suportados, incluindo mais de 500 antes nunca atendidos por nenhum sistema ASR. Encoders variam de 300M a 7B. A Meta também disponibilizou o Omnilingual ASR Corpus, com 350+ idiomas subatendidos.
O Whisper large-v3, 1,55B, MIT, 99 idiomas, já foi superado em precisão por cerca de dez modelos abertos, mas permanece a escolha razoável para uma fatia grande de projetos. O MIT é a licença menos restritiva do campo, e o ecossistema de runtime — whisper.cpp, faster-whisper, WhisperX — não tem equivalente entre os lançamentos mais novos.
Casos especiais e arquiteturas experimentais
O MOSS-Transcribe-Diarize 0.9B, Apache 2.0, 50+ idiomas, emite rótulos de locutor, timestamps por palavra e transcrição em uma única geração, em vez de encadear ASR a um stack separado de diarização. Tem contexto de 128k, processa cerca de 90 minutos em uma única passada e atinge RTF ~0,017 em uma RTX 4090, com hotword biasing.
O diffusion-gemma-asr-small, da startup Interfaze, é a proposta arquitetônica mais original do ano. Produz transcrições via denoising paralelo por difusão sobre uma tela de 256 tokens em 8 a 16 passos, de modo que o custo de decodificação não cresce com o tamanho da transcrição. Apenas cerca de 42M parâmetros foram treinados — 0,16% dos pesos — sobre um DiffusionGemma 26B congelado e um encoder whisper-small também congelado. Atinge 6,6% de WER no LibriSpeech test-clean a 11–17× tempo real. No FLEURS em inglês o número sobe para 15,7% e no mandarim FLEURS chega a 29,6% de CER — o que limita o resultado do LibriSpeech a teto. Ninguém deveria colocar isso em produção ainda; quem trabalha com ASR deveria ler.
Licença como fator de decisão
A MarkTechPost divide os modelos abertos pelo regime de licenciamento. Sob Apache 2.0 estão Cohere Transcribe, Granite Speech 4.1 (nas três variantes), Qwen3-ASR (ambos os tamanhos), Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR e MOSS-Transcribe — uso comercial livre, sem obrigação de atribuição. O repositório da Cohere, porém, exige dados de contato antes do download, ainda que a licença do modelo seja Apache 2.0.
Sob MIT está apenas o Whisper large-v3, a opção mais permissiva do campo. Sob CC-BY-4.0 estão Canary-Qwen-2.5B, Parakeet TDT 0.6B v3 e Kyutai STT — uso comercial viável, mas com atribuição obrigatória. Para produtos embarcados ou APIs white-label, essa obrigação de compliance é, segundo a publicação, o motivo mais comum para times acabarem colocando em produção um modelo que não é o mais preciso dos testados.
O que observar a partir de agora
O resumo relevante de 2026, segundo a MarkTechPost, não é que um único modelo venceu. É que um modelo aberto de 2B parâmetros sob licença permissiva já supera o que APIs fechadas cobravam há cerca de 18 meses, e que a decisão de compra virou uma questão de procurement, não de pesquisa. As posições no leaderboard mudam com frequência; todos os números do levantamento foram verificados em fontes primárias em 23 de julho de 2026. Para projetos novos, vale cruzar três variáveis antes de bater o martelo: idioma-alvo, regime de licença compatível com o produto e custo por hora de áudio processada no hardware disponível.
Este conteúdo tem caráter exclusivamente informativo e não constitui recomendação de investimento ou aconselhamento financeiro. Criptomoedas são ativos de alta volatilidade e podem provocar perdas financeiras significativas.
