La startup francesa Kog asegura que puede hacer que las GPU que ya poseen las empresas generen hasta 30 veces más inferencia de IA, con una demostración que alcanzó 3.000 tokens por segundo. Su fundador, Gaël Delalleau, espera implementar un modelo grande a velocidad 10 veces superior en septiembre y lograr la tracción necesaria para su ronda Serie A.
***
- Kog promete acelerar la inferencia de modelos de IA en GPUs estándar sin necesidad de hardware nuevo.
- La empresa ya tiene 200 clientes potenciales y planea demostrar su tecnología con modelos grandes en septiembre.
- El enfoque de bajo nivel, basado en hacking y física, requiere semanas de ingeniería para cada tipo de GPU.
La carrera por una inferencia de IA más rápida está en plena efervescencia, con empresas como Cerebras debutando en bolsa con chips especializados. Sin embargo, la startup francesa Kog apuesta por una vía distinta: exprimir al máximo el rendimiento de las GPU que ya están en manos de las empresas, sin necesidad de adquirir hardware nuevo. Según TechCrunch, la empresa fundada por Gaël Delalleau presentó en mayo una vista previa técnica que causó revuelo en Hacker News.
La promesa de Kog: 30 veces más velocidad con software
Kog demostró que es posible una decodificación extremadamente rápida en GPU estándar como la AMD MI300X y la NVIDIA H200, alcanzando 3.000 tokens por segundo por solicitud, aunque con un modelo pequeño de 2.000 millones de parámetros llamado Laneformer 2B, que ya es de código abierto. La promesa es lograr una inferencia 30 veces más rápida, algo que atrajo a más de 200 clientes potenciales, según Delalleau.
El CEO espera que la ingeniería de software sea el primer caso de uso, dirigido a usuarios que dependen de flujos de trabajo de IA para tareas profesionales y que sufren con las esperas, como ocurre con herramientas como Claude Code. Además, la startup tiene socios de diseño que generan juegos y aplicaciones con un mensaje, y para quienes una respuesta más rápida significaría más ingresos.
Sin embargo, la empresa se da cuenta de que el mercado aún no está del todo maduro. Delalleau aprendió que sus potenciales clientes no están preparados para ajustar modelos pequeños, por lo que desde el lanzamiento se ha enfocado en acelerar el desarrollo de modelos más grandes para satisfacer la demanda observada. Esta decisión deja a Kog con un gran salto por delante para cumplir su promesa de inferencia 30 veces más rápida.
No obstante, el CEO confía en que el mismo enfoque puede funcionar igual de bien con los LLM, cuyo tamaño puede ser un desafío para los chips de inferencia. “Las GPU tienen un futuro brillante”, dijo, y sostiene que las GPU más nuevas tienen cada vez más ancho de banda de memoria que solo pide ser liberado.
De la demostración al reto de los LLM
Contradiciendo a los escépticos, Delalleau asegura que la idea de que las GPU no son adecuadas para la decodificación es un error. Kog no está sola en este pensamiento: ZML, también de Francia, lanzó un software independiente del hardware que evita el CUDA de Nvidia para admitir inferencia rápida en chips de la competencia. Pero Delalleau compara a Kog con el laboratorio Hazy Research de Stanford, por su enfoque a un nivel aún más profundo en la aceleración de GPU.
El fundador no es investigador, y su primera startup, Stribe, nada tuvo que ver con esto, salvo por su excofundador convertido en capitalista de riesgo Kamel Zeroual, cuya firma Varsity VC colideró la ronda semilla de Kog. La experiencia única de Delalleau proviene de estudiar física del estado sólido en la École Polytechnique y de trabajar en ciberseguridad ofensiva, también conocida como hacking de sombrero blanco.
Según Delalleau, esta formación moldeó una mentalidad de entender las leyes de la física y de la GPU para aprovecharlas al máximo. En cuanto al hacking, el cuatro veces finalista en el torneo CTF de DEF CON dijo que le enseñó a hacer ingeniería inversa a nivel de lenguaje ensamblador y binario, para usar los dispositivos para fines para los que no fueron diseñados.
La desventaja de este enfoque es que es muy práctico y requiere mucho tiempo. Para cada nueva GPU, Kog dedica varias semanas o incluso meses para profundizar en los detalles y realizar investigaciones de ingeniería en ese hardware. Con un equipo de 11 personas, esto pone un límite al número de chips con los que Kog puede trabajar, al menos en el futuro previsible.
El enfoque de bajo nivel: física y hacking
La metodología de Kog combina física del estado sólido con hacking ético, lo que les permite entender las leyes de la GPU a un nivel muy bajo. Delalleau, que estudió en la École Polytechnique, pasó de la ciencia pura a la ciberseguridad ofensiva, y eso le dio una perspectiva única para optimizar el rendimiento de los chips.
Su participación en torneos de hacking como DEF CON CTF, donde fue cuatro veces finalista, le enseñó a hacer ingeniería inversa hasta el código binario. Esta habilidad es clave para encontrar atajos en el hardware que otros no ven, y para exprimir cada ciclo de procesamiento disponible.
El proceso es laborioso y requiere paciencia: cada nueva generación de GPU exige investigar desde cero sus mecanismos internos. A largo plazo, Kog espera automatizar parte de este trabajo mediante tuberías basadas en agentes, lo que les permitiría soportar más chips y modelos sin necesidad de expandir tanto el equipo.
A pesar del tiempo que consume, Delalleau cree que vale la pena, porque las GPU tienen un potencial enorme que el software convencional no explota. La idea de que las GPU no sirven para la inferencia es un mito que su empresa está decidida a derribar.
El respaldo europeo y los próximos pasos
Mientras Europa busca construir su propia capacidad en IA, Kog podría beneficiarse de un fuerte viento de cola soberanista. La startup ya cuenta con el apoyo de Scaleway y el respaldo del programa French Tech 2030 de la Bpifrance, lo que le da una ventaja en términos de financiamiento y visibilidad regional.
Delalleau reconoce que aún deben demostrar que su enfoque funciona con los LLM, y que eso será clave para conseguir más inversión. “Una vez que implementemos nuestro primer modelo importante a una velocidad 10 veces mayor, que creo que será en septiembre, podremos comenzar a demostrar la tracción de los clientes y a partir de ahí, recaudar nuestra Serie A”, afirmó.
Si logran ese hito, Kog no solo habrá validado su tecnología, sino que habrá abierto un camino para que muchas empresas aprovechen al máximo sus inversiones en GPU. La promesa de 3.000 tokens por segundo con un modelo pequeño es solo el comienzo, y el mundo observa con atención.
El futuro de Kog depende de su capacidad para escalar su método a los grandes modelos de lenguaje, que son los que realmente exigen una inferencia rápida en aplicaciones profesionales. Con un equipo compacto pero altamente especializado, la startup francesa se posiciona como un contendiente inesperado en la carrera por la velocidad de la IA.
ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.
Suscríbete a nuestro boletín
Artículos Relacionados
Biohacking
Mapa tecnológico 2026: 10 avances de hoy para entender el mañana
Estados Unidos
BofA: una victoria republicana en el Senado impulsaría el rally de acciones de IA
Empresas
Guerra de precios: OpenAI y Anthropic recortan tarifas por presión de la IA china
Hyperscalers