Por Canuto  

MatrAIx es una infraestructura que simula 8.3 mil millones de usuarios para evaluar sistemas de IA y productos digitales. Con 1.290 dimensiones de personalidad y cuatro entornos de prueba, ya completó 18.189 ensayos con una adherencia del 91.5%.
***

  • MatrAIx crea 8.3 mil millones de registros de personajes con un esquema unificado de 1.290 dimensiones.
  • Ofrece cuatro entornos de evaluación: encuestas, chatbots, web y aplicaciones nativas.
  • Validado en 18.189 ensayos con tres modelos de IA, logró una adherencia del 91.5% en comportamiento controlado.


El paper MatrAIx: Simulating the World with 8.3 Billion Persona Agents presenta una infraestructura de evaluación de usuarios simulados a escala poblacional. Escrito por Xiaomin Li, Yuexing Hao y más de un centenar de colaboradores de prestigiosas universidades, el estudio propone un sistema completo para probar IA y productos digitales con una diversidad sin precedentes.

La evaluación humana de sistemas de IA es costosa, lenta y difícil de escalar. Los benchmarks offline ofrecen una alternativa, pero no capturan la diversidad ni el comportamiento interactivo de los usuarios reales. MatrAIx busca cerrar esa brecha con una población simulada de 8.3 mil millones de personajes, cada uno con atributos demográficos, psicológicos, de capacidad y estilo de vida.

La plataforma tiene tres componentes principales: Persona 8B, un conjunto de datos masivo; MatrAIx Playground, con cuatro entornos de interacción; y MatrAIx Applications, una biblioteca de 1.010 tareas. Los autores ejecutaron 18.189 ensayos en ocho tareas representativas con tres modelos de lenguaje de gran escala, validando la adherencia y la calidad de las extracciones.

Los resultados muestran que los agentes simulados siguen sus personajes asignados en un 91.5% de los casos. La extracción de personajes de fuentes humanas obtuvo una puntuación media de 4.135 sobre 5 en una evaluación humana. Esta infraestructura promete cambiar la pre-selección de productos y la investigación de experiencia de usuario.

Persona 8B: una población simulada

Persona 8B contiene 8.3 mil millones de registros, cada uno definido por 1.290 dimensiones categóricas que abarcan antecedentes, psicología, capacidades, comportamiento y estilo de vida. Se construyó con dos enfoques complementarios: generación sintética y extracción de fuentes reales.

Los registros sintéticos se generan mediante un gráfico acíclico dirigido que preserva las correlaciones entre atributos. Por ejemplo, la competencia en inglés se ajusta según la lengua materna y la región. También se aplican reglas de compatibilidad, como excluir a alguien cuya lengua materna es inglés pero tiene competencia nula.

Los registros con base humana provienen de seis fuentes: biografías de Wikipedia, historiales de reseñas de Amazon, encuestas de Stack Overflow, la Encuesta Social General, perfiles PRISM y una encuesta voluntaria. Se mapean al mismo esquema y se desidentifican, eliminando identificadores directos.

El conjunto de datos público depurado contiene aproximadamente un millón de personajes: 599.847 extraídos de fuentes humanas y 400.000 sintéticos. Se aplicaron controles de calidad, deduplicación y calibración hacia distribuciones demográficas reales para los márgenes de edad, región, género y urbanicidad.

La representación permite consultas por edad, región, idioma, experiencia o necesidades de accesibilidad. Esto facilita muestrear cohortes específicas para cada estudio. Cada dimensión incluye una descripción en lenguaje natural, lo que convierte un registro en un perfil legible.

Cuatro entornos de evaluación

MatrAIx Playground ofrece cuatro tipos de entornos: encuestas, chatbot de IA, web y aplicaciones nativas. Cada uno define cómo los agentes interactúan con el sistema bajo prueba.

El tipo I permite a los agentes completar cuestionarios para concept testing, predicción de mercado y estudios de sensibilidad al precio. Por ejemplo, se puede evaluar cuántos consumidores seguirían comprando un producto tras un aumento de precio.

El tipo II coloca a los agentes en conversaciones con asistentes de IA o chatbots de atención al cliente. Se mide si los usuarios continúan tras una respuesta incorrecta, o cómo la latencia afecta la satisfacción.

El tipo III usa agentes que navegan por sitios web con automatización de navegador. Se evalúan recomendaciones, facilidad para encontrar opciones y decisiones de compra. El tipo IV opera aplicaciones de escritorio o móviles en sandboxes, permitiendo probar descubrimiento de funciones y cambios de ajustes.

Cada entorno registra las interacciones completas, incluyendo pensamientos, acciones y resultados. Se almacenan métricas de duración, finalización y verificación. Esto soporta análisis a nivel de subgrupos y poblaciones, no solo promedios generales.

Validación y resultados

Los investigadores ejecutaron ocho tareas, dos de cada entorno, con tres modelos de lenguaje: Claude Opus 4.8, GPT 5.5 y Claude Haiku 4.5. En las tareas de encuesta, chatbot y web usaron aproximadamente 1.000 personajes por modelo; en aplicaciones, alrededor de 20 por su mayor costo.

La adherencia al personaje se probó en un estudio controlado de 400 ensayos con diez atributos de comportamiento. Los agentes expresaron o suprimieron correctamente el comportamiento declarado en 366 ensayos, un 91.5%. El entorno de aplicaciones mostró la menor adherencia, con 83%.

La calidad de extracción de personajes humanos se evaluó con jueces LLM y humanos. Dos LLM puntuaron 1.000 extracciones con alta concordancia: 89.1% de las puntuaciones pares estaban dentro de un punto. Seis humanos calificaron una submuestra de 100 con una media de 4.135 sobre 5.

También se analizó la consistencia de los efectos de personaje entre modelos. En la tarea OpenBB, el nivel de confianza separó subgrupos bajo los tres modelos con el mismo orden. Esto sugiere que los efectos del personaje son recuperables cuando la tarea ofrece un canal claro.

Un hallazgo importante es que el modelo que actúa como agente puede cambiar drásticamente los resultados. En una prueba de sensibilidad al precio, la proporción de agentes que dudaron varió del 27% al 98.3% según el modelo. Por lo tanto, los resultados deben interpretarse con cautela y validarse con humanos para decisiones críticas.

Conclusión y perspectivas

MatrAIx ofrece una infraestructura integral para evaluar IA y productos digitales con usuarios simulados heterogéneos. Combina un conjunto de datos masivo, entornos versátiles y una biblioteca de tareas reutilizables. La validación end-to-end demostró su operación en todas las configuraciones.

Este sistema permite pruebas de pre-despliegue, análisis de subgrupos, pruebas de estrés y comparaciones entre versiones. Los hallazgos importantes deben verificarse con múltiples modelos y rastrearse hasta las interacciones subyacentes. La evaluación humana sigue siendo necesaria antes de aplicar conclusiones a poblaciones reales.

Los autores recomiendan que cualquier resultado relevante sea comprobado por humanos. También destacan la necesidad de cerrar la brecha sim-to-real, especialmente en comportamientos como divulgación, corrección y abandono. Planean expandir los entornos y mejorar la fidelidad a largo plazo.

El proyecto está disponible en código abierto, con el conjunto de datos Persona 1M público. Esto permite a otros investigadores reproducir y extender los experimentos.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín