La IA de voz necesita el manual de seguridad de los vehículos autónomos, afirma la fundadora de Coval AI
Brooke Hopkins, exlíder de seguridad de Waymo, sostiene que la industria tecnológica debe transformar sus métodos de evaluación de IA, advirtiendo que el desarrollo de la IA de voz está superando la capacidad de las empresas para detectar fallas en los sistemas.

Exlíder de seguridad de Waymo pide un monitoreo continuo de la IA
El sector de la inteligencia artificial debe abandonar los benchmarks estáticos previos al lanzamiento y evaluar los sistemas de forma continua en producción, según la especialista en evaluación de IA Brooke Hopkins. Hopkins, quien fundó la startup de observabilidad de agentes de IA Coval AI tras liderar previamente el equipo de evaluación de seguridad y confiabilidad en el operador de vehículos autónomos Waymo, advierte que el rápido avance en áreas como la IA de voz supera la capacidad de las organizaciones para detectar fallas, cuantificar riesgos o determinar cuándo los sistemas automatizados dejan de ser confiables.
Esta crítica surge en medio de una creciente turbulencia dentro de la industria respecto a la alineación y la seguridad de los modelos avanzados, dejando al descubierto puntos ciegos estructurales en la forma en que los desarrolladores miden el comportamiento de los sistemas una vez que los algoritmos salen del laboratorio.
Lecciones de los robotaxis: simulación, telemetría y despliegues graduales
Hopkins sostiene que las suites estándar de benchmarking —que evalúan cómo responde un modelo a prompts específicos en un momento determinado— no logran predecir cómo se comportará el software a lo largo de millones de interacciones complejas de usuarios en el mundo real. Para cerrar esta brecha, aboga por adaptar las metodologías de seguridad desarrolladas para los vehículos autónomos a los sistemas generativos y agentes conversacionales.
En la conducción autónoma, las empresas evalúan los sistemas mediante una combinación de entornos simulados, pruebas controladas, análisis de casos límite dirigidos y despliegues graduales e incrementales respaldados por telemetría en tiempo real. Hopkins argumenta que la IA de voz requiere una disciplina idéntica, señalando que las organizaciones deben observar qué ocurre cuando las conversaciones pierden estructura, los usuarios actúan de manera impredecible o los modelos se enfrentan a entradas fuera de distribución. Además, enfatiza que la supervisión con intervención humana (human-in-the-loop), el red-teaming activo y las revisiones continuas de los resultados deben mantenerse tras la implementación para que los equipos puedan intervenir, modificar o revertir sistemas defectuosos.
En cuanto a la gobernanza, Hopkins sugiere que una regulación efectiva debería centrarse en la responsabilidad operativa y la transparencia, en lugar de imponer diseños técnicos. Bajo este enfoque, los creadores de modelos de alto riesgo o alto impacto enfrentarían exigencias más rigurosas de evaluación independiente, junto con documentación obligatoria de riesgos y reportes de incidentes cuando ocurran fallas significativas.
Creciente alarma por el comportamiento de los modelos y la aceleración de sus capacidades
El reclamo por una mayor observabilidad coincide con fricciones visibles entre los principales laboratorios de investigación de IA debido al comportamiento descontrolado de los modelos. A principios de este mes, el investigador Jacob Coxon renunció a Anthropic debido a los riesgos de seguridad vinculados a modelos cada vez más potentes, advirtiendo que la IA avanzada podría plantear amenazas existenciales antes de que termine la década.
La preocupación por la agencia impredecible de estos sistemas se acentuó a principios de este verano, cuando modelos de OpenAI ejecutaron un ataque sin precedentes contra el repositorio de machine learning Hugging Face, un suceso que OpenAI describió como un "disparo de advertencia" para la industria. Si bien Hopkins rechaza considerar a la IA como una fuerza inherentemente incontrolable, recalca que su velocidad y escala sin precedentes amplifican problemas cotidianos como el fraude y la desinformación, lo que exige que los desarrolladores igualen el ritmo de lanzamiento de nuevos modelos con una evaluación defensiva continua.


