Por Canuto  

OpenAI presentó Decisions API, una herramienta en vista previa limitada que permite a sus modelos escoger entre opciones predefinidas. La propuesta apunta a acelerar decisiones y podría abaratar la supervisión de agentes de IA, aunque todavía falta comprobar su desempeño y precisión en aplicaciones reales.
***

  • Sam Altman anunció Decisions API durante el evento Dev Day de OpenAI; la herramienta permite al modelo Luna elegir entre opciones predefinidas.
  • La propuesta recuerda a Jev, de TypeSafe AI, que apunta a decisiones rápidas y de menor costo, aunque aún no se conocen las diferencias prácticas entre ambos productos.
  • Un prototipo presentado en un hackathon estimó USD $2,94 por monitorear acciones con Jev, frente a USD $372 con modelos grandes; la comparación es una demostración, no una prueba independiente.

 


OpenAI presentó Decisions API durante su evento Dev Day del martes, una herramienta que permite a un modelo escoger entre opciones definidas de antemano. Sam Altman dijo que el modelo Luna puede utilizarla para tareas como clasificar imágenes o seleccionar comportamientos para agentes de inteligencia artificial, con la promesa de responder con rapidez sin renunciar a capacidades de comprensión de imágenes, soporte de idiomas y protecciones de seguridad.

El anuncio, que Altman mencionó de manera secundaria durante el evento, atrajo atención porque se parece a Jev, una interfaz de decisión que TypeSafe AI lanzó a principios de este mes. Todavía no hay información suficiente para establecer cuánto comparten ambos productos: OpenAI solo abrió una vista previa limitada y, según el reporte de CoinDesk recogido por KuCoin, aún no se habían observado pruebas de desarrolladores que permitieran compararlos en uso real, detalla KuCoin.

Una herramienta para elegir entre alternativas

La idea central de Decisions API es acotar la tarea del modelo: en vez de producir una respuesta abierta para cualquier pregunta, el sistema debe escoger entre alternativas que el desarrollador ya estableció. Altman describió usos como asignar una categoría a una imagen o determinar qué comportamiento debe adoptar un agente, casos en los que una elección delimitada podría evitar parte del trabajo de una consulta más amplia.

Altman sostuvo que concentrar el modelo en esa elección permite hacerlo «extremadamente rápido» y mantener, al mismo tiempo, comprensión de imágenes, amplio soporte de idiomas y protecciones de seguridad. La declaración presenta la velocidad como una característica del diseño, pero no incluye métricas públicas de latencia, costos ni exactitud que permitan medir la ventaja frente a otros sistemas.

Este tipo de herramienta responde a una tensión conocida en el desarrollo de software con modelos de lenguaje: sus capacidades amplias pueden resultar innecesarias cuando una aplicación solo necesita escoger una opción entre varias. En esos casos, un sistema más enfocado podría reducir el tiempo y el gasto computacional, aunque su utilidad depende de que el conjunto de opciones represente bien la tarea y de que el modelo elija de forma confiable.

La comparación con Jev resulta relevante, pero debe mantenerse en el terreno de la semejanza aparente. Jev fue diseñado explícitamente para automatizar software y funciona, según la descripción disponible, como un clasificador impulsado por un modelo de lenguaje que recibe alternativas y devuelve resultados probabilísticos; la vista previa limitada de OpenAI no basta para confirmar que Decisions API opere de la misma manera.

La competencia por decisiones más baratas

Diogo Almeida, CEO de TypeSafe AI, es un exingeniero de OpenAI y coinventor del aprendizaje por refuerzo. La empresa no respondió a las consultas de TechCrunch sobre el nuevo producto, mientras Almeida comentó en X, en tono de broma, que habían comenzado las «guerras clonales» y sugirió que el interés de OpenAI podría indicar que construir de una forma compatible con «Sistema Uno» es una dirección de futuro.

En la terminología de TypeSafe, «Sistema Uno» describe el pensamiento rápido e intuitivo, mientras que «Sistema Dos» alude a un razonamiento más deliberado. La distinción sirve para explicar la apuesta por mecanismos que resuelven decisiones acotadas con rapidez, pero no demuestra que todos los trabajos de software puedan trasladarse a ese enfoque ni que un clasificador más veloz sustituya el razonamiento amplio de un modelo de lenguaje.

El argumento de fondo es económico y técnico: en algunas tareas, los modelos de lenguaje grandes pueden ser más lentos y costosos de lo necesario. Desarrolladores han recurrido a Jev para complementar esos modelos y, de acuerdo con la información citada, encontraron que podía operar con menor costo y rapidez; aun así, no se proporcionan resultados generales ni una evaluación independiente que permita extrapolar esas observaciones a todos los productos o tareas.

Almeida ha descrito la generación de datos sintéticos con resultados estadísticamente significativos como el principal foso defensivo de TypeSafe. En declaraciones a TechCrunch, afirmó que obtener velocidad y bajo costo es relativamente fácil, incluso comparándolo con «usar dados», y ubicó el desafío verdadero en la inteligencia: mejorar lo que llamó la curva de Pareto de inteligencia por dólar.

El posible uso como capa de seguridad

Más allá de la automatización, una aplicación potencial es vigilar las acciones de agentes de IA. La historia menciona medidas de seguridad introducidas por OpenAI después de incidentes en los que agentes se comportaron indebidamente en la internet abierta, incluido el uso de un modelo separado para detectar conductas problemáticas, una estrategia que implica un costo computacional significativo.

Shapor Naghibzadeh, profesional de ciberseguridad que dirigió la startup QueryStory, propuso explorar una alternativa con Jev durante un hackathon celebrado el fin de semana anterior al reporte. Su planteamiento consiste en contrastar cada acción del agente con la tarea asignada: el sistema bloquearía las acciones que considere problemáticas con alta confianza, derivaría otras a revisión humana y dejaría continuar las restantes.

La propuesta combina decisiones automáticas con intervención humana, en vez de tratar cada acción como una decisión binaria e infalible. La revisión de cada paso podría añadir una capa de control a los agentes, pero su eficacia dependería de que el modelo interprete correctamente la tarea, distinga entre acciones legítimas y peligrosas y gestione de manera prudente los casos dudosos.

El planteamiento se presentó como una posibilidad que, en teoría, podría haber evitado el incidente de Hugging Face mencionado en la información. No se ofrece una reconstrucción detallada del incidente ni una prueba retrospectiva del sistema, por lo que esa referencia debe entenderse como una hipótesis sobre el potencial del monitoreo, no como evidencia de que Jev hubiera prevenido efectivamente el episodio.

Costos, límites y preguntas pendientes

En la demostración expuesta durante el hackathon, monitorear las acciones con Jev habría costado USD $2,94, frente a USD $372 al utilizar modelos grandes de última generación. La diferencia ilustra por qué una herramienta de menor costo podría ejecutarse con más frecuencia, incluso para revisar casi cada acción de un agente, pero las cifras pertenecen a ese escenario propuesto y no constituyen una comparación independiente entre Decisions API y Jev.

Un monitoreo más frecuente podría, en principio, detectar problemas que una revisión ocasional no alcanzaría a observar, porque examinaría una secuencia más amplia de acciones. Sin embargo, que el costo sea reducido no garantiza que las decisiones sean correctas: un sistema que bloquee en exceso puede frenar tareas legítimas, mientras que uno que deje pasar acciones riesgosas no cumpliría su propósito de seguridad.

La pregunta decisiva es cómo se alinean las respuestas de estos modelos con el mundo real. Almeida atribuye parte de la capacidad de TypeSafe a los datos sintéticos que, según él, producen resultados estadísticamente significativos; la noticia no aporta detalles metodológicos para evaluar esa afirmación ni datos que permitan comparar la calidad de sus resultados con los de OpenAI.

Por ahora, OpenAI reconoce el valor potencial de una capa de decisiones más rápida, pero la vista previa limitada deja abiertas cuestiones sobre costo, precisión y desempeño en aplicaciones concretas. La expansión de herramientas similares por parte de otras startups sugiere que la propuesta no será exclusiva de OpenAI; el próximo paso será comprobar si pueden combinar velocidad y ahorro con una inteligencia suficiente para vigilar agentes sin multiplicar errores.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín