Anthropic incorporará evaluadores de Accenture dentro de sus procesos de desarrollo de inteligencia artificial para revisar modelos mientras todavía están siendo entrenados y antes de limitar el análisis a un producto terminado. El esquema contempla acceso comparable al de un empleado, con capacidad para observar decisiones sobre construcción y despliegue, además de comunicarse directamente con los equipos involucrados.
La iniciativa será encabezada por Faculty, el negocio especializado en IA de Accenture, que trabajará en evaluación y red teaming de modelos, análisis de alineación y pruebas de las salvaguardas utilizadas por Anthropic. Las dos compañías prevén destinar al menos US$1.000 millones cada una durante los próximos cinco años para desarrollar capacidad en esta área.

Anthropic prueba un modelo de evaluación desde dentro del desarrollo
El planteamiento busca que una organización independiente pueda seguir la evolución del modelo y revisar el funcionamiento de la empresa desde una posición que normalmente no está disponible para los evaluadores externos. Entre las funciones previstas aparecen comprobar compromisos de seguridad, detectar puntos ciegos e informar incidentes, aunque Anthropic establece que la responsabilidad por la seguridad de sus modelos continuará recayendo sobre la propia compañía.
El sistema todavía no tiene reglas comunes sobre cuánto acceso deben recibir estos evaluadores ni sobre cómo deben comunicar sus hallazgos. Tampoco existe un mecanismo establecido para financiar este tipo de trabajo independiente, por lo que Anthropic pagará directamente las evaluaciones realizadas por Accenture y plantea que, a largo plazo, el financiamiento podría provenir de fondos conjuntos o fuentes gubernamentales.

Anthropic también mantiene conversaciones con METR y otras organizaciones sin fines de lucro para probar partes de este modelo mediante esquemas de financiamiento diferentes. El acuerdo con Accenture no será exclusivo, ya que Anthropic anticipó la incorporación de otros evaluadores y Accenture podrá realizar trabajos equivalentes con otros desarrolladores de inteligencia artificial.

