Por Canuto  

Un estudio de Mercor comparó modelos de IA con contadores públicos certificados en tareas contables estructuradas. La empresa reportó que los modelos fueron más rápidos, precisos y baratos en esos ejercicios, pero el benchmark amplio muestra que aún no completan todas las tareas de principio a fin.
***

  • Doce contadores públicos certificados participaron en ejercicios contables; tenían, en promedio, cinco años y medio de experiencia.
  • Mercor informó que los modelos evaluados superaron a los contadores en rapidez y precisión en las tareas probadas, y que su costo fue 10 veces menor en esa comparación.
  • El benchmark completo abarca 160 tareas en 10 empresas simuladas. Mercor identificó a Claude Fable 5 como el modelo mejor clasificado, con 56,4%.

 


Los modelos de inteligencia artificial avanzaron en tareas contables estructuradas y, en una prueba de Mercor, superaron a contadores públicos certificados en rapidez y precisión. La empresa también reportó que el costo de los modelos fue 10 veces menor en esa comparación. El resultado se refiere a los ejercicios evaluados y no permite estimar por sí solo cuánto ahorraría una empresa al automatizar toda su área contable.

La distancia entre resolver tareas concretas y completar el trabajo contable de principio a fin es central para interpretar los resultados. El benchmark más amplio de Mercor incluye labores de cierre contable y muestra un desempeño menos concluyente que el de los ejercicios acotados. Sus resultados no demuestran que los modelos puedan cerrar los libros sin supervisión humana, indica The Register.

El desempeño en las tareas simplificadas

Para la comparación directa, Mercor reunió a 12 contadores públicos certificados, conocidos como CPA por sus siglas en inglés, con una media de cinco años y medio de experiencia. Los participantes trabajaron en tareas simplificadas tomadas del APEX Accounting Benchmark, diseñado para evaluar labores contables mediante criterios definidos.

En esos ejercicios, la empresa informó que los modelos de IA fueron más rápidos y precisos que los contadores. También señaló que el costo de los modelos fue 10 veces menor. La comparación permite observar una diferencia en las tareas probadas, pero no equivale a medir el costo de automatizar todas las funciones de un departamento contable.

El desempeño reportado se refiere a actividades acotadas y estructuradas, no a una validación de que los modelos puedan encargarse por sí solos de la contabilidad integral de una organización. Por eso, los resultados deben leerse en función de las condiciones y el alcance de la prueba.

El benchmark amplio muestra límites persistentes

El APEX Accounting Benchmark completo comprende 160 tareas distribuidas en 10 empresas simuladas. Más de 40 profesionales contribuyeron a su elaboración y contaban con una media de 11 años de experiencia, según los datos presentados junto con el estudio.

En la clasificación publicada por Mercor, Claude Fable 5 quedó en primer lugar, con 56,4%. Esa cifra corresponde a su resultado en el benchmark; no debe confundirse con una proporción de tareas que el modelo haya completado íntegramente.

El estudio también señala que ningún modelo resolvió por completo casi 60% de las tareas del conjunto. Aunque los sistemas pueden cumplir partes de una instrucción y obtener puntuaciones relevantes, el resultado apunta a dificultades para integrar todos los requisitos de algunos encargos de principio a fin.

La prueba amplia se enfoca en labores de contabilidad de cierre, como la conciliación y el registro de operaciones, y no cubre áreas como impuestos o auditoría, según la descripción del benchmark. Por ello, sus resultados no representan todas las responsabilidades de un contador ni permiten generalizar el desempeño a cualquier función contable.

La supervisión humana sigue en el centro

Las pruebas comparan el desempeño de los modelos en tareas delimitadas, pero no miden por completo aspectos del trabajo contable cotidiano, como conversar con clientes, coordinarse con colegas o aplicar contexto acumulado. Una puntuación en el benchmark no ofrece por sí sola una medida integral del trabajo de un contador.

En consecuencia, los resultados no plantean que los contadores puedan desaparecer de los procesos contables. Aunque Mercor observa ventajas de rapidez, precisión y costo en los ejercicios evaluados, el desempeño en el benchmark completo deja margen para errores y tareas sin resolver. La supervisión humana sigue siendo relevante, en particular cuando se requiere completar un cierre contable.

La lectura práctica es más acotada que una promesa de automatización total: la IA puede agilizar ciertas labores estructuradas bajo las condiciones evaluadas, mientras que los resultados no justifican asumir que puede hacerse cargo de todo el proceso sin revisión. El impacto en cada empresa dependerá de cómo se integren estas herramientas y de las tareas que se les asignen.


Imagen original de DiarioBitcoin, creada con inteligencia artificial, de uso libre, licenciada bajo Dominio Público.

Este artículo fue escrito por un redactor de contenido de IA y revisado por un editor humano para garantizar calidad y precisión.


ADVERTENCIA: DiarioBitcoin ofrece contenido informativo y educativo sobre diversos temas, incluyendo criptomonedas, IA, tecnología y regulaciones. No brindamos asesoramiento financiero. Las inversiones en criptoactivos son de alto riesgo y pueden no ser adecuadas para todos. Investigue, consulte a un experto y verifique la legislación aplicable antes de invertir. Podría perder todo su capital.

Suscríbete a nuestro boletín