Los humanos siguen tomando las decisiones en el desarrollo de modelos asistidos por IA, según un estudio
El análisis de un equipo de la Universidad de Fudan de más de 700 registros de tareas muestra que los agentes de IA manejan la mayoría de los pasos rutinarios, pero los humanos toman la gran mayoría de las decisiones estratégicas.

Qué ocurrió, quién y cuándo
El 27 de septiembre de 2026, investigadores de la Universidad de Fudan en China publicaron un estudio que examina cómo los participantes humanos y los agentes de IA colaboraron para crear un nuevo modelo de lenguaje agente, Atria Dawn Preview. La investigación abarcó más de 700 registros de tareas generados por 56 participantes que trabajaron con la cadena de desarrollo del modelo.
Principales hallazgos del estudio
- La participación de la IA es casi ubicua: los agentes de IA se utilizaron en el 96,5 % de las tareas revisadas.
- Aumento de la dependencia de los agentes: durante un período de cuatro semanas, la razón mediana de acciones de los agentes frente a entradas humanas aumentó de 11 a 28,5, lo que indica que los participantes delegaron más trabajo a los agentes a medida que avanzaba el proyecto.
- Tareas habilitadas por la IA: de 455 tareas asistidas por IA completadas, 151 (aproximadamente un tercio) se consideraron inviables sin IA, una opinión compartida por 27 de los 56 participantes.
- Distribución de la toma de decisiones: para las elecciones de métodos y parámetros, “IA propone, humano selecciona” representó el 55,4 % de las interacciones. Los humanos tomaron el 85,5 % de las decisiones sobre métodos/parametros y el 93,4 % de las decisiones finales sobre objetivos y alcance, mientras que la IA aportó solo el 9,2 % de las decisiones de método/parametro y se mantuvo en porcentajes de un solo dígito para las decisiones finales.
- Intervención humana en casos problemáticos: en 588 tareas con dificultad registrada, los humanos intervinieron en el 76 % de los casos, principalmente añadiendo contexto (35,2 %) o diagnosticando problemas y cambiando métodos (34,7 %). Los agentes resolvieron el 23 % de las tareas difíciles por sí mismos. Las tomas de control total por parte de humanos ocurrieron en solo el 0,7 % de los casos; las ediciones parciales fueron un 3,2 %.
- Bucle de retroalimentación: después de recibir retroalimentación humana, la IA revisó sus propios resultados el 75,4 % de las veces, lo que sugiere que la ejecución, no el juicio, es el cuello de botella.
- Evolución del rol de la IA: los autores describen tres fases —sujeto de investigación, herramienta a nivel de tarea y socio de proyecto— donde la IA ahora redacta y ajusta planes dentro de los objetivos definidos por humanos. Una cuarta fase especulativa involucraría la auto‑mejora recursiva, aunque el estudio señala que los modelos actuales pueden mejorar en tareas de entrenamiento sin volverse mejores en diseñar sucesores.
- Riesgo de validación automática: el artículo advierte que, a medida que los agentes manejan cadenas de trabajo más largas, la supervisión humana puede degradarse a una mera “validación automática”, especialmente cuando los participantes ejecutan agentes de forma autónoma por conveniencia en lugar de por diseño.
Contexto industrial y desarrollos relacionados
Los hallazgos llegan en medio de un acalorado debate sobre la auto‑mejora recursiva. El CEO de Anthropic, Dario Amodei, ha pedido un límite de velocidad en la investigación de IA, señalando que en Anthropic los humanos ahora toman solo porcentajes de un solo dígito de las decisiones de dirección de la investigación. Según se informa, OpenAI emplea GPT‑5.6 Sol a lo largo de todo su ciclo de desarrollo, mientras que Google y DeepMind utilizan agentes como Dream‑RSI para explorar estrategias de búsqueda alternativas, aunque no para rediseñar los modelos en sí. Más de mil empleados de la industria de IA han advertido recientemente que sus compañías podrían estar al borde de automatizar la investigación de IA por completo. Un estudio independiente de Princeton y el UK AI Security Institute coincide con los resultados de Fudan, mostrando que los modelos de frontera sobresalen en la ingeniería de investigación pero fallan en las decisiones de juicio de alto nivel que finalmente importan.

