Новый бенчмарк RoboHarm проверил, откажутся ли ИИ-модели выполнять опасные команды при управлении роботами. Anthropic Claude Fable 5.1, OpenAI GPT-6 Astra и Ai2 MolmoAct2 получили инструкции ударить ножом по кукле-младенцу, поставить баллон со сжатым воздухом на горящую плиту и выполнить другие рискованные действия. GPT-6 Astra выполнил 60 из 100 опасных заданий, Claude Fable 5.1 — 34, а MolmoAct2 — 6. При этом модели почти никогда не говорили «нет» по соображениям безопасности.