Medido, no prometido

Idiomas mezclados, salas reales, y los números detrás de ambos.

Esto es lo que dicen las tablas de abajo, antes de que las leas: una mezcla enrutada de modelos le gana a un solo modelo de propósito general justo donde el habla se pone difícil —otros idiomas, idiomas mezclados, un teléfono sobre la mesa de una sala—. Cada número lo medimos nosotros, sobre datasets públicos que cualquiera puede descargar, y cada uno lleva al lado el tamaño de su muestra. Nada de esta página es el comunicado de un proveedor.

Cada cifra es tasa de error de palabra a nivel de corpus —errores totales sobre palabras totales de referencia— y se vuelve a medir cada vez que cambia el enrutamiento. Menos es mejor.

Medido en audio real

Datasets públicos, con nombre — descárgalos tú mismo.

Google FLEURS, Multilingual LibriSpeech y el AMI Meeting Corpus. Los tres se publican bajo licencias Creative Commons, así que podemos decirte exactamente qué fragmentos usamos y tú puedes bajar los mismos. Estos son los números por los que respondemos.

Sinsonte — una mezcla de modelos

Sinsonte no corre un solo modelo de transcripción. Cada grabación pasa por una mezcla —parte de los modelos son nuestros, parte están licenciados— y el enrutador elige entre ellos según el idioma que se habla y la sala en que se habló. Una mezcla de idiomas es lo que obliga a una mezcla de modelos: un modelo por grabación se compromete con un idioma y escribe el resto de la conversación como si también lo hubiera oído en ese idioma. Y ningún modelo gana en todo, además: el que va adelante en español leído no es el que sobrevive a un teléfono olvidado sobre la mesa de una reunión. Elegir bien, grabación por grabación, es el producto. Así que esta columna no reporta el puntaje de un modelo: reporta lo que entrega la mezcla enrutada en esa condición.

Whisper large-v3 — el estándar abierto

El único modelo que nombramos, y a propósito. Es lo que buena parte de las herramientas de transcripción corre por debajo, se descarga gratis, y puedes reproducir esta columna tú mismo sobre los mismos clips en una tarde. Una referencia que puedes verificar vale más que cinco que tienes que creer — por eso es contra la que pedimos que nos midan.

La receta es nuestra

Qué modelos componen la mezcla, y cómo el enrutador elige entre ellos, no lo publicamos: la receta es nuestra. Todo lo demás sigue siendo reproducible —los datasets, los splits, la semilla de muestreo, los identificadores de cada clip, la normalización del texto y la métrica están publicados—, y la columna de referencia es una descarga gratuita. Cualquiera puede volver a correrla y confirmar que nuestro número se midió igual, sobre el mismo audio, el mismo día.

Tasa de error de palabra, %, a nivel de corpus. Menos es mejor. La ficha ámbar marca la cifra de Sinsonte.
Condición clips min Sinsonte Whisper large-v3
FLEURS es-419 — español latinoamericano 22445.1 3.33.4
FLEURS pt-BR — portugués de Brasil beta 21045.2 5.15.7
FLEURS en-US — inglés 27745.1 4.85.7
MLS español — narración de audiolibro 17745.1 2.84.1
MLS portugués — audiolibro, portugués europeo beta 17645.2 3.86.8
AMI-SDM — inglés, sala de reuniones real, un solo micrófono lejano 19418.0 12.823.9

Dicho en palabras: con 3,3% en español latinoamericano, unas 97 de cada 100 palabras vuelven exactamente como se dijeron. En audiolibro en portugués, 3,8% frente al 6,8% de la referencia abierta son casi la mitad de errores. Y cuanto más se aleja el audio de un estudio, más se abre esa distancia — que es justo la razón por la que enrutamos.

12.8%

La sala es donde se caen las herramientas gratis.

AMI-SDM es una reunión real grabada por un solo micrófono puesto sobre la mesa, con varias personas y sin diademas: la condición para la que está hecho Sinsonte y la que los benchmarks suelen saltarse. En 194 fragmentos (18 minutos), Sinsonte marca 12,8% de error de palabra frente al 23,9% de Whisper large-v3: el mismo audio, casi la mitad de errores. Es la diferencia más ancha de esta página, y es la que importa, porque una sala de reuniones no es un caso raro — es un martes.

Qué se siente un 12,8%: más o menos una palabra de cada ocho que vale la pena mirar dos veces, en la condición más difícil que hay — un teléfono al otro lado de la sala de quien está hablando. La referencia abierta falla cerca de una de cada cuatro sobre el mismo audio. Y nunca tienes que buscar cuál: cada línea lleva su ▶ mm:ss, así que comprobarla cuesta un solo toque.

Las diferencias no son parejas, y ahí está el argumento. El audio limpio y bien articulado es un problema resuelto: en español leído cualquiera que sepa lo que hace llega al mismo sitio, nosotros incluidos. La mezcla se gana el sueldo donde un solo modelo de propósito general deja de dar la talla: otros idiomas, idiomas mezclados y salas. Tres puntos en audiolibro en portugués; once en una sala de reuniones real. Ahí es donde viven tus grabaciones.

Separación de voces — medida

Quién habla, medido igual que lo que dijo.

Acertar las palabras no sirve de nada si se le atribuyen a la persona equivocada. Cada grabación pasa por una etapa de separación de voces antes de que empiece la transcripción, y la medimos con el mismo criterio que las tablas de arriba: datasets públicos, etiquetas de referencia correctas, el mismo arnés de puntuación en cada corrida.

DER —tasa de error de diarización— es la fracción del tiempo total de una reunión que queda asignada a la voz equivocada, se pierde como si no fuera habla, o se inventa como habla que nunca ocurrió. No dice nada sobre qué se dijo, solo de quién era el turno. Menos es mejor.

La etapa de separación de voces de Sinsonte

Cada grabación pasa por un paso de separación de voces antes de la transcripción, elegido con el mismo criterio que la mezcla de transcripción: por lo que mide mejor según el tipo de sala de donde vino el audio. No decimos qué motor es, por la misma razón que no nombramos la mezcla de transcripción: el enrutamiento es el producto.

El diarizador de código abierto líder

La herramienta de separación de voces de código abierto más usada del mundo, gratuito para descargar y correr tú mismo sobre los mismos datasets públicos. Igual que Whisper en las tablas de arriba, es la única referencia de esta página que nombramos por categoría y no por producto, porque cualquiera puede reproducirla.

Tasa de error de diarización, %, collar de 0,25 s (la convención NIST/DIHARD). Menos es mejor. La ficha ámbar marca la cifra de Sinsonte.
Condición min Sinsonte Diarizador de código abierto
AMI Meeting Corpus — reunión real, inglés (muestra 1) 5.0 23.131.1
AMI Meeting Corpus — reunión real, inglés (muestra 2) 5.0 11.016.7
CallHome — llamada telefónica en español 2.5 15.130.5
VoxConverse — inglés, audio en línea (muestra 1) 1.4 14.411.4
VoxConverse — inglés, audio en línea (muestra 2) 0.6 5.110.9
Media (n=5) 14.5 13.720.1

Dicho en palabras: con un promedio de 13,7% de DER, unos siete minutos de cada ocho de una reunión quedan con el hablante correcto; la referencia de código abierto acierta eso en unos cuatro de cada cinco. La distancia más ancha está en la única muestra en español —una llamada real, no sintética— donde la etapa de Sinsonte marca 15,1% frente a 30,5%: prácticamente la mitad de la confusión.

15.1%

La única muestra en español dice lo mismo que las tablas de arriba.

callhome-spa-0 es una llamada telefónica real en español, no un diálogo de estudio. La etapa de separación de voces de Sinsonte marca 15,1% de DER frente a 30,5% del diarizador de código abierto líder, sobre el mismo audio: la mitad de la confusión, en el idioma para el que existe esta página entera.

n=1. Una llamada real en español es evidencia, no un estudio terminado —la misma salvedad que esta página hace en todo lo demás—. Existen otros dos clips de CallHome en español y quedaron excluidos por completo: los dos fallaron una revisión básica de saturación antes de que cualquier motor los tocara, corruptos desde el origen, no un resultado que se haya ganado ningún lado.

Esto no gana siempre, y mostramos la fila donde no gana: en una de las cinco muestras la referencia de código abierto marca menos (11,4% frente a 14,4%, las dos en inglés, las dos de VoxConverse). Cinco muestras, un idioma más allá del inglés, es evidencia real y no un estudio terminado — más muestras de diarización en español es lo siguiente en esta lista, igual que la afirmación de español a distancia de arriba.

Medido en estudio · validación en curso

Las mezclas — donde se nota la especialidad.

Spanglish, portuñol, pt-en: frases que cambian de idioma a media frase y no le avisan a nadie. Para esto está hecho Sinsonte, y es donde la distancia entre una mezcla enrutada y un solo modelo es la más ancha de toda la página.

Medido sobre diálogos de estudio generados por nosotros; la validación con grabaciones reales está en curso.

Tasa de error de palabra, %, sobre nuestro propio conjunto de referencia — diálogos de estudio, variante limpia. Muestras pequeñas: n es por condición. Las mismas dos columnas de arriba.
Condición clips Sinsonte Whisper large-v3
Spanglish, cambiando a media frase 3 1.13.1
Español/inglés, cambiando entre frases 4 7.349.6
Portugués + inglés, mezclado beta 1 3.2
Portuñol — portugués + español beta 1 9.8

La fila que hay que mirar es la segunda. Una conversación que cambia de idioma entre frases es donde un solo modelo se compromete con un idioma y escribe el resto como si también lo hubiera oído así: se equivoca en más o menos una palabra de cada dos. La mezcla enrutada se equivoca en una de cada catorce. En portuñol —dos idiomas lo bastante cercanos como para confundirse— es una de cada doce contra una de cada cinco.

FFER — tasa de error por falso amigo

Cuántas veces un motor cambia una palabra por su falso amigo del idioma vecino en lugar de escribir lo que realmente se dijo. Construimos la métrica porque nadie más la mide.

El español y el portugués están lo bastante cerca como para que los motores de transcripción «arreglen» uno convirtiéndolo en el otro. Alguien hablando portuñol dice que el estado quedó em rojo —una palabra en español dentro de una frase en portugués— y el motor escribe em vermelho, porque es lo que debería decir una frase portuguesa bien educada. Fluido. Verosímil. No es lo que se dijo.

Eso cuesta una palabra de error y cambia un hecho. Sinsonte escribe decisiones y pendientes directamente de la transcripción, así que le construimos una métrica: la tasa de error por falso amigo. Nuestras grabaciones de referencia llevan 25 trampas marcadas; en cada una el modelo o conservó lo que se dijo, o lo cambió por la palabra del otro idioma —ese cambio es el FFER—, o lo destrozó, y eso último lo dejamos deliberadamente fuera del numerador para que el ruido normal no infle el número.

20%

Hasta el mejor modelo suelto reescribe uno de cada cinco falsos amigos.

Ese es el mejor que hemos medido, sobre portuñol limpio y con la trampa marcada de antemano: cuatro de cada cinco palabras sobreviven, y la quinta se convierte en silencio en la palabra del otro idioma. El peor motor que probamos reescribe siete de cada diez sin apenas destrozar una sílaba: fluido, seguro de sí mismo, y no es lo que se dijo.

Que es exactamente la razón por la que Sinsonte no le entrega el portuñol a un solo modelo para después dar la respuesta por buena. Donde hay un falso amigo en juego marcamos la palabra en vez de tomar partido en silencio, y decide quien lee — con el ▶ ahí mismo para oír lo que de verdad se dijo.

Metodología, datasets y límites

Puntuación

Tasa de error de palabra a nivel de corpus: errores totales divididos por palabras totales de referencia de esa condición, no un promedio de resultados por clip. El texto se normaliza como lo hace el Open ASR Leaderboard, con un cambio deliberado: las tildes y la ñ se conservan en vez de quitarse, porque una transcripción que las pierde no es una transcripción en español. Cada hipótesis queda guardada, así que se puede volver a puntuar sin volver a correr audio.

Muestreo y escala

Semilla 42 en todo, unos 45 minutos de audio por condición de audio real y 18 minutos para la de sala de reuniones: 1 258 fragmentos, 4,1 horas. Cada fragmento pasó por seis motores, y de ahí salen las 24,6 horas de evaluación de esta página — 4,1 × 6. Los splits de prueba de FLEURS son más chicos que el buffer de mezcla, así que la muestra es una permutación uniforme exacta del split completo. El identificador de cada fragmento queda escrito en un manifiesto, para que cualquiera pueda volver a bajar y volver a puntuar la misma muestra. La ronda publicada aquí se corrió el 8 y 9 de agosto de 2026 y se vuelve a correr cada vez que cambia el enrutamiento.

Huecos conocidos del muestreo

El índice de la sala de reuniones cubre alrededor del 92,5% del split disponible: siete páginas del catálogo devolvían errores por límite de peticiones mientras se armaba, y seguimos de largo en vez de reintentar para siempre. La muestra sigue siendo sembrada y reproducible; solo que sale de ese 92,5%, y preferimos escribir esta frase antes que dejarte suponer otra cosa.

Whisper large-v3, reconfirmado

Una ronda de seguimiento el 15 de agosto de 2026 volvió a probar Whisper large-v3 —junto a otros tres modelos de transcripción que no aparecen en esta página— sobre muestras más chicas de las mismas familias de clips usadas arriba: de 3 a 5 clips por condición, promediados por clip y no a nivel de corpus. Confirmó que Whisper large-v3 se equivoca más en cada condición que tocó: 4,5% en español latinoamericano y 3,6% en audiolibro en español, ambos cerca del 3,4% y el 4,1% publicados arriba; 55,2% en cambio de idioma español/inglés entre frases, cerca del 49,6% de arriba; y 8,5% en spanglish a media frase, bien por encima del 3,1% de arriba. Hay dos resultados que vale la pena decir en claro en vez de promediarlos hasta que desaparezcan: en inglés limpio, Whisper large-v3 devolvió una transcripción vacía en un clip de 4,3 segundos que no está en silencio —eso solo explica la mayor parte de un promedio bruto de 34,6%—; quitando solo ese clip baja a 18,2%, todavía peor que el 5,7% de arriba. Y en audio real de sala de reuniones a distancia, los cuatro clips de esta ronda más chica marcaron 61,0%, muy por encima del 23,9% de la ronda más grande de arriba —las dos son mediciones genuinas del mismo modelo abierto sobre audio genuinamente difícil, no una contradicción por resolver—. La misma ronda también sorprendió a Whisper large-v3-turbo traduciendo un clip en español al inglés en vez de transcribirlo. Nada de esto cambia las cifras de Sinsonte publicadas arriba: fue una ronda de confirmación solo para Whisper, que mantenemos aparte porque su muestra fue más chica que el resto de esta página.

Los datasets, y las licencias que nos dejan publicar esto

  • Google FLEURS

    Habla leída en 102 idiomas; usamos los splits de prueba es-419, pt-BR y en-US.

    CC BY 4.0 · huggingface.co/datasets/google/fleurs

  • Multilingual LibriSpeech

    Narración de audiolibros; usamos los splits de prueba de español y portugués. El de portugués es portugués europeo, no brasileño — parte de por qué puntúa distinto.

    CC BY 4.0 · openslr.org/94

  • AMI Meeting Corpus

    Reuniones reales de varias personas grabadas en salas instrumentadas. Usamos el split de prueba de micrófono lejano único — el audio público más parecido a un teléfono sobre la mesa.

    CC BY 4.0 · groups.inf.ed.ac.uk/ami/corpus

  • VoxConverse

    Audio de varios hablantes tomado de video en línea, con las etiquetas de turno de habla de referencia. Usamos dos clips del split de prueba.

    CC BY 4.0 · github.com/joonson/voxconverse

  • CallHome (Spanish)

    Conversaciones telefónicas reales en español, con las etiquetas de turno de habla de referencia. Licencia de investigación, no redistribuible: podemos decirte qué llamada usamos, no entregarte el archivo.

    CC BY-NC-SA 4.0, research only · huggingface.co/datasets/talkbank/callhome

Los límites, dichos en claro

  • No comparamos a Sinsonte contra otros productos. Las dos columnas son cosas que corrimos nosotros mismos, sobre los mismos clips el mismo día — un número copiado de la página de marketing de un competidor no es una medición.
  • No revelamos qué modelos componen la mezcla ni cómo el enrutador elige entre ellos. Es deliberado: el enrutamiento es el producto. Lo que publicamos en cambio es nuestro propio resultado junto a una referencia que cualquiera puede descargar y volver a correr.
  • No afirmamos ser los mejores en español. Qué enfoque gana cambia con la condición, que es justamente la razón por la que enrutamos en vez de estandarizar en un solo modelo.
  • Todavía no hacemos ninguna afirmación sobre español a distancia: AMI es en inglés, y es nuestra única grabación de sala genuinamente real. Grabar sesiones consentidas en español en salas ruidosas es lo siguiente en esta lista.
  • Los números de idiomas mezclados están medidos sobre diálogos de estudio generados por nosotros, no sobre grabaciones del mundo real, y las muestras son pequeñas: no existe un dataset público de habla conversacional español–inglés o portugués–español con el que tengamos licencia para publicar resultados. Tres detalles que vale la pena saber: el 1,1% de spanglish a media frase descansa en un solo clip (los demás candidatos quedan entre 1,7% y 7,4%), la voz la generó un sistema cuyo fabricante también vende transcripción, y la fila de «entre frases» se arma pegando grabaciones distintas una tras otra, lo que castiga a cualquier modelo que se aferre a un idioma por clip. La validación con grabaciones reales está en curso; estos números van etiquetados como medidos en estudio en todos los lugares donde aparecen, incluida nuestra portada.
  • Ningún número de esta página sale de la grabación de un usuario. Ni uno, nunca: ni para medir, ni para entrenar, ni para una demo. Todo lo de aquí es data pública o audio que hicimos a propósito.
  • Las filas de portugués mezclado y portuñol de arriba se actualizaron el 15 de agosto de 2026, después de una decisión de enrutamiento que movió las dos condiciones a otro motor de la mezcla; las cifras nuevas son n=1 por condición, la misma salvedad de siempre en esta sección. Whisper large-v3 no se probó sobre las grabaciones de esa ronda, así que no mostramos cifra de referencia para esas dos filas en vez de emparejar un número nuevo con uno viejo de otra ronda.
  • Los números de separación de voces de la sección nueva de arriba son tasa de error de diarización, no tasa de error de palabra, medidos sobre su propio set de cinco clips de grabaciones públicas reales —una muestra mucho más chica que la que usan las tablas de transcripción. Existen otros dos clips en español dentro de ese dataset y quedaron excluidos por completo: los dos fallaron una revisión básica de saturación antes de que cualquier motor los tocara, corruptos desde el origen. La referencia de código abierto gana en una de las cinco muestras (VoxConverse, 11,4% frente a 14,4%), que mostramos en vez de esconder.

El arnés de pruebas, el código de puntuación y el manifiesto fragmento por fragmento todavía no son públicos — el repositorio donde viven también tiene el producto. Están disponibles a pedido para quien quiera revisar un número: escribe a [email protected] y te los mandamos.

← Volver a Sinsonte