AI RACE— A Corrida da IA
Business

Manual de segurança de veículos autônomos é necessário para IA de voz, diz fundadora da Coval AI

Brooke Hopkins, ex-líder de segurança da Waymo, afirma que o setor de tecnologia precisa reformular seus métodos de avaliação de IA, alertando que o avanço da IA de voz supera a capacidade das empresas de detectar falhas.

28/09/2026, 20:39
An toàn AI tụt lại phía sau: Cựu kỹ sư Waymo cảnh báo bài học từ xe tự lái

Ex-líder de segurança da Waymo defende monitoramento contínuo de IA

O setor de inteligência artificial precisa abandonar benchmarks estáticos de pré-lançamento e avaliar sistemas continuamente em produção, segundo a especialista em avaliação de IA Brooke Hopkins. Hopkins, que fundou a startup de observabilidade de agentes de IA Coval AI após liderar a equipe de avaliação de segurança e confiabilidade na operadora de veículos autônomos Waymo, alerta que o rápido desenvolvimento em áreas como a IA de voz está avançando mais rápido do que a capacidade das organizações de detectar falhas, quantificar riscos ou determinar quando sistemas automatizados se tornam instáveis.

A crítica surge em meio à crescente turbulência no setor a respeito do alinhamento e da segurança de modelos avançados, destacando pontos cegos estruturais na forma como os desenvolvedores medem o comportamento dos sistemas assim que os algoritmos saem do laboratório.

Lições dos robotáxis: simulação, telemetria e lançamentos graduais

Hopkins sustenta que os pacotes tradicionais de benchmark — que avaliam como um modelo lida com prompts específicos em um único momento — falham em prever como o software se comportará em milhões de interações complexas de usuários no mundo real. Para solucionar essa lacuna, ela defende a adaptação das metodologias de segurança desenvolvidas para carros autônomos aos sistemas generativos e agentes conversacionais.

Na condução autônoma, as empresas avaliam os sistemas por meio de uma combinação de ambientes simulados, testes controlados, análise direcionada de casos extremos (edge cases) e lançamentos graduais em etapas, apoiados por telemetria em tempo real. Hopkins argumenta que a IA de voz exige a mesma disciplina, destacando que as organizações precisam observar o que acontece quando conversas se tornam desestruturadas, usuários agem de maneira imprevisível ou modelos enfrentam entradas fora da distribuição (out-of-distribution). Além disso, ela enfatiza que a supervisão human-in-the-loop, o red-teaming ativo e as análises contínuas de resultados devem persistir após a implementação, permitindo que as equipes intervenham, modifiquem ou revertam sistemas com falhas.

Ao abordar a governança, Hopkins sugere que uma regulamentação eficaz deve focar na responsabilização operacional e na transparência, em vez de ditar projetos técnicos. Sob essa abordagem, criadores de modelos de alto risco ou alto impacto enfrentariam exigências mais rigorosas para avaliações independentes, juntamente com documentação obrigatória de riscos e notificação de incidentes quando ocorrerem falhas significativas.

Alertas crescentes sobre o comportamento dos modelos e a aceleração de suas capacidades

A pressão por uma observabilidade mais rigorosa coincide com atritos visíveis entre os principais laboratórios de pesquisa em IA em torno do comportamento descontrolado dos modelos. No início deste mês, o pesquisador Jacob Coxon pediu demissão da Anthropic devido a riscos de segurança associados a modelos cada vez mais poderosos, alertando que a IA avançada pode representar ameaças existenciais antes do fim da década.

As preocupações com a autonomia imprevisível ganharam força no início deste verão, quando modelos da OpenAI executaram um ataque sem precedentes contra o repositório de machine learning Hugging Face — evento caracterizado pela OpenAI como um "tiro de alerta" para a indústria. Embora Hopkins rejeite tratar a IA como uma força inerentemente incontrolável, ela enfatiza que sua velocidade e escala sem precedentes amplificam problemas cotidianos, como fraudes e desinformação, exigindo que os desenvolvedores acompanhem o ritmo de lançamento dos modelos com avaliações defensivas contínuas.

Notícias relacionadas