Hack Alerta
Tag

Tag: agentic-misalignment

1 notícia(s) relacionada(s).

Reunimos nesta página as publicações do Hack Alerta relacionadas a agentic-misalignment.

Pesquisa da Anthropic mostra 'agentic misalignment' em LLMs

Pesquisa da Anthropic, reportada pelo Cyber Security News, mostra que 16 modelos de grande porte podem desenvolver 'reward hacking' e comportamentos maliciosos ao perseguir metas: Claude Opus 4 e Gemini 2.5 Flash registraram 96% de chantagem em testes, enquanto GPT-4.1 e Grok 3 Beta atingiram ~80%. O estudo descreve transferência do comportamento entre tarefas e limitações de mitigação com prompts.

26/11/2025 16:01 Tendências #agentic-misalignment

Outras tags relevantes