Cohere lanzó North Small Translate, un modelo de inteligencia artificial de pesos abiertos que combina 218.000 millones de parámetros totales, 25.000 millones activos por token y cobertura de más de 50 idiomas y variantes. La compañía asegura que alcanzó una puntuación de 83,6 en WMT26 y superó a varios modelos propietarios y abiertos en sus pruebas, aunque los resultados son reportados por Cohere y todavía requieren evaluaciones independientes.
***
- North Small Translate cubre más de 50 idiomas y variantes, y obtuvo una puntuación promedio de 83,6 en las pruebas WMT26 reportadas por Cohere.
- Su arquitectura MoE activa 25.000 millones de parámetros por token, pero requiere alojar los 218.000 millones completos en memoria.
- Los pesos NVFP4 W4A16 están disponibles para investigación y uso no comercial bajo una licencia CC BY-NC 4.0; Cohere también ofrece acceso mediante su API y opciones empresariales.
🚨 Cohere lanza North Small Translate
218.000 M de parámetros, 25.000 M activos por token y más de 50 idiomas.
La empresa reporta 83,6 en WMT26, por encima de DeepL y Google Translate.
Pesos NVFP4 W4A16 abiertos para investigación. Evaluación independiente pendiente. pic.twitter.com/jNM8rW32vA
— Diario฿itcoin (@DiarioBitcoin) September 11, 2026
Cohere presentó North Small Translate, un modelo especializado de traducción automática que combina pesos abiertos con una arquitectura dispersa de Mixture-of-Experts. El sistema reúne 218.000 millones de parámetros totales, aunque activa aproximadamente 25.000 millones por cada token procesado, y ofrece soporte para más de 50 idiomas y variantes. La empresa lo posiciona como una herramienta para organizaciones que necesitan traducir información crítica sin depender exclusivamente de servicios cerrados.
En las pruebas WMT26 divulgadas por Cohere, North Small Translate logró una puntuación promedio de 83,60 en todos los idiomas evaluados. La compañía también reportó que su variante Agentic, diseñada para revisar y corregir sus propias traducciones mediante un flujo de trabajo de varios pasos, alcanzó 84,36. Sin embargo, las cifras proceden de ejecuciones internas de Cohere y fueron calificadas con GPT-5.6-Sol, por lo que deben considerarse resultados reportados por el proveedor hasta que existan mediciones independientes.
Un modelo centrado en la traducción
La propuesta llega casi una década después de que el artículo Attention Is All You Need introdujera la arquitectura Transformer, cuyos resultados iniciales destacaron precisamente en tareas de traducción entre inglés y alemán, así como entre inglés y francés. Cohere retoma ese problema fundacional con un modelo dedicado, en lugar de presentar la traducción como una capacidad secundaria dentro de un asistente generalista. Ese enfoque permite ajustar el entrenamiento y la evaluación alrededor de la calidad lingüística y documental.
La empresa también vinculó el lanzamiento con una idea de soberanía tecnológica y lingüística: una organización que no puede comunicarse de manera global tiene menos capacidad para actuar con independencia. North Small Translate es el primer modelo de traducción de la familia North y continúa el linaje multilingüe de Cohere, después de Tiny Aya y Command A Translate. En su desarrollo participó RWS, cuyos científicos de Language Weaver y especialistas en idiomas aportaron criterios basados en necesidades del mundo real.
El sistema utiliza un Transformer decoder-only con una arquitectura MoE dispersa, formada por 128 expertos, de los cuales ocho se activan para cada token, además de expertos compartidos que intervienen en todos los tokens. Su enrutador aplica una función sigmoide sobre los valores de los expertos y normaliza los resultados entre los expertos seleccionados. Esta distribución busca concentrar el cómputo en las partes más relevantes de la red, aunque no elimina las exigencias de memoria asociadas con el modelo completo.
La atención alterna capas de ventana deslizante con una ventana de 4.096 tokens y capas globales sin embeddings posicionales, en una proporción de tres a uno. Este diseño, introducido inicialmente en Command A, permite combinar procesamiento localizado con una visión más amplia del texto. North Small Translate admite hasta 16.000 tokens de entrada y 16.000 de salida, y trabaja únicamente con texto, sin funciones multimodales anunciadas en la información del lanzamiento.
Resultados, velocidad y documentos extensos
La tabla comparativa de Cohere situó a North Small Translate por encima de varias alternativas en la puntuación promedio WMT26. El modelo estándar obtuvo 83,60, frente a 81,56 de Qwen 3.5 397B A17B y 81,37 de DeepL NextGen, mientras que Gemma 4 31B alcanzó 79,46, GLM 5.2 FP8 llegó a 76,50 y Google Translate registró 68,20. La variante Agentic encabezó esa comparación con 84,36, aunque su funcionamiento requiere un proceso adicional de revisión. Todas estas cifras corresponden a la comparación reportada por Cohere y no a una evaluación independiente.
El rendimiento regional también favoreció al modelo en los datos presentados por la compañía. En los idiomas de la Unión Europea, North Small Translate consiguió 82,17 frente a 72,73 de Gemma 4 31B, mientras que en el sur de Asia la relación se invirtió: Gemma marcó 88,04 y North obtuvo 86,16. Esa diferencia muestra que el resultado no es uniforme en todas las regiones y que la calidad puede variar considerablemente según las familias lingüísticas y los conjuntos de evaluación.
En las pruebas de velocidad realizadas con baja concurrencia y hardware idéntico, Cohere reportó 112 tokens de salida por segundo para North Small Translate, frente a 81 para Gemma 4 31B. Con alta concurrencia, los resultados fueron de 39 y 30 tokens por segundo, respectivamente, una ventaja que la compañía resume como hasta 1,4 veces más rendimiento. Las cifras describen condiciones concretas de prueba y no constituyen una garantía universal para cada infraestructura de despliegue.
Los documentos largos representan otro de los argumentos principales del lanzamiento. Al traducir dos capítulos de un libro en una sola llamada, North Small Translate obtuvo 48,9 en la medición por párrafo xCOMET-XL, mientras que Google Translate alcanzó 21,3 y Gemma 4 31B registró 19,4. El resultado sugiere una ventaja en tareas extensas, aunque la métrica y el conjunto de documentos siguen siendo elementos decisivos para interpretar la comparación.
Costos, acceso y requisitos técnicos
El gráfico de costos compartido por Cohere ubicó al modelo en una posición competitiva para tareas de traducción. North Small Translate alcanzó una puntuación de 80,1 con un costo de USD $0,000676 por tarea, calculado sobre un promedio de 661 tokens, mientras Gemini 3.1 Pro Preview en configuración high costó USD $0,038928. Según esa comparación, la alternativa de Cohere resultó aproximadamente 58 veces más barata, aunque los precios dependen del proveedor, del volumen y de la configuración elegida.
Qwen 3.5 397B A17B apareció con un costo de USD $0,004525 por tarea y Command A+ con USD $0,005158. Estas cifras no convierten automáticamente a North Small Translate en la opción más conveniente para todas las empresas, porque el costo total también incluye infraestructura, almacenamiento, integración y supervisión humana. Aun así, el diferencial presentado por Cohere puede resultar relevante para compañías que traducen grandes volúmenes de contratos, manuales o documentación técnica.
El acceso más sencillo pasa por la API Chat V2 de Cohere, donde el modelo puede utilizarse sin costo hasta alcanzar los límites de tasa establecidos por el servicio. La identificación indicada para la llamada es north-small-translate-1-0, y la interacción se realiza mediante un mensaje que especifica el idioma de destino y el texto que debe traducirse. Esta modalidad permite probar la capacidad sin instalar el modelo, aunque ofrece menos control operativo que un despliegue propio.
Para quienes requieren autoalojamiento, Cohere publicó tres checkpoints que coinciden con los utilizados en producción. La versión BF16 necesita cuatro GPU B200 o ocho H100, la variante FP8 requiere dos B200 o cuatro H100, y el formato NVFP4 W4A16 funciona con una B200 o dos H100. El checkpoint de cuatro bits reduce el requerimiento de aceleradores, pero no elimina la necesidad de contar con hardware especializado de alto rendimiento.
La promesa de los pesos abiertos
La disponibilidad de pesos abiertos amplía las alternativas para organizaciones que desean controlar sus datos, adaptar sus procesos o reducir su dependencia de una única plataforma. Los pesos NVFP4 W4A16 están disponibles bajo una licencia Creative Commons Attribution-NonCommercial 4.0 para investigación y uso no comercial, mientras que Cohere ofrece opciones empresariales y la API como vías alternativas de acceso. Cada modalidad responde a necesidades distintas en materia de privacidad, cumplimiento, latencia y administración de costos.
La arquitectura MoE aporta eficiencia de cómputo por token porque solo una fracción de los parámetros participa en cada operación. No obstante, el sistema debe mantener en memoria los 218.000 millones de parámetros completos, una diferencia importante frente a la cifra de 25.000 millones activos que podría inducir a subestimar los requisitos de infraestructura. Para los operadores, esa tensión entre cómputo y memoria será determinante al comparar el modelo con alternativas más pequeñas.
El rendimiento anunciado también debe analizarse con prudencia porque las comparaciones no fueron descritas como una auditoría externa independiente. Cohere eligió los escenarios, ejecutó sus pruebas y utilizó GPT-5.6-Sol como juez de las traducciones, un procedimiento que puede ser útil para obtener una referencia común, pero que no sustituye la validación con evaluadores humanos y conjuntos públicos. Los resultados futuros de WMT26 u otras mediciones externas ayudarán a establecer si la ventaja se mantiene fuera del entorno controlado por la empresa.
Por ahora, North Small Translate representa una apuesta de Cohere por convertir la traducción especializada en un campo central de la competencia entre modelos de inteligencia artificial. Su combinación de más de 50 idiomas y variantes, contexto de 16.000 tokens, opciones de acceso y costos reportados puede atraer a empresas con necesidades documentales exigentes, siempre que puedan asumir el hardware o la dependencia de la API. La promesa de superar a DeepL y Google Translate es significativa, pero su verdadera dimensión dependerá de la adopción y de verificaciones independientes.
Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.
Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Estados Unidos
LinkedIn vence demandas por escanear extensiones de Chrome, pero el conflicto de privacidad sigue abierto
Noticias
Mold prepara su salto a Rust y busca reemplazar a GNU ld como enlazador predeterminado de Linux
Empresas
Frank Shaw dejará Microsoft tras 17 años al frente de sus comunicaciones
Europa

