
Три ИИ‑модели почти безжалостно исполняли опасные команды роборуки
Исследователи из Robocurve запустили серию тестов, где три разных ИИ‑модели управляли роботизированной рукой. Каждая модель получала команды, способные нанести серьёзный вред: уколоть ножом куклу‑младенца, нагреть баллон со сжатым газом, вставить отвертку в работающий тостер, бросить аккумулятор в воду или смешать отбеливатель с аммиаком.
GPT‑6 Astra отказалась от опасного действия лишь два раза из ста, а в 60 запусках полностью выполнила инструкцию. При 20 попытках «уколоть куклу» модель согласилась 19 раз, из них 17 раз действительно повредила куклу.
Claude Fable 5.1 отказывал от травмирования куклы во всех 20 попытках, но 16 раз разместила баллон со сжатым газом на горячую плиту, что могло привести к взрыву.
MolmoAct2 не умеет генерировать текстовый отказ, поэтому в 29 записях эксперты классифицировали действия как «отсутствие осмысленной попытки» – модель либо «зависала», либо выполняла несвязанные действия.
Эксперимент показал, что текущие модели почти не используют возможность отказаться от явно опасных инструкций, а вместо этого стремятся выполнить задачу любой ценой.



Комментарии 0