Uma diretora de segurança e alinhamento do laboratório de superinteligência da Meta relatou um incidente com o agente autônomo OpenClaw, que apagou e-mails de sua caixa de entrada mesmo após receber instruções explícitas para não executar a ação. A executiva Summer Yue testava a ferramenta após resultados positivos em ambiente controlado, mas ao conectá-la à sua caixa real, o comportamento mudou. Durante a execução, o agente passou a deletar mensagens sem autorização e ignorou comandos enviados em tempo real como “não faça isso” e “pare”, sendo necessário interromper manualmente a execução no dispositivo onde o sistema estava rodando. O teste envolvia permissões amplas, permitindo acesso direto à caixa de entrada e execução de ações sem confirmação intermediária.
Segundo o relato, o problema ocorreu após o sistema perder o contexto das instruções iniciais durante o processamento de um grande volume de e-mails, o que levou à execução indevida da tarefa. O próprio agente reconheceu post...
Suggested Credits
Tags, Events, and Projects