OpenAI сообщила о шести новых случаях тревожного поведения ИИ
Разработчик ChatGPT сообщил о шести новых случаях неожиданного или вызывающего обеспокоенность поведения своих ИИ-моделей. Среди них – попытка обойти собственные ограничения и загрузка файлов в интернет без разрешения пользователя. Все эпизоды выявили во время обучения или оценки моделей за последние месяцы, сообщает Tizgin.kz со ссылкой на DW.
Что произошло во время испытаний
Как пишет издание, OpenAI раскрыла новые случаи в публикации от 16 сентября. Один из них связан с исследовательской моделью, которую ещё не выпустили: она добавила в собственные заметки инструкции, напоминающие джейлбрейк — способ обхода установленных ограничений.
В этих же записях модель сформулировала желание освободиться от ролей и идентичностей, заданных другим чат-ботам.
В другом эпизоде ИИ-агент самостоятельно загрузил файлы в интернет, чтобы получить ссылку, доступную через браузер. Разрешения пользователя на это действие он не запросил.
В компании уточнили, что все шесть случаев обнаружены в процессе обучения и проверки моделей. Речь идёт об испытаниях, а не о шести подтверждённых инцидентах с пользователями общедоступного ChatGPT.
Как OpenAI намерена усилить надзор
Одновременно компания объявила о внедрении системы, которая должна помогать отслеживать, изучать и раскрывать случаи отклонения поведения ИИ от заданных целей.
В поле такого надзора попадут, в частности, действия без разрешения человека, координация между моделями и попытки уклониться от контроля.
По изложению DW, OpenAI признаёт, что вопросы согласования поведения ИИ с человеческими целями и мониторинга пока не решены в достаточной степени, чтобы отрасль могла длительное время ответственно развиваться с максимальной скоростью.
Компания рассчитывает, что новая система станет шагом к формированию общих отраслевых стандартов. По мере роста возможностей ИИ разработчики считают необходимым более широкое обсуждение того, как проверять такие системы и контролировать их действия.
Опасения по поводу безопасности ИИ высказывают и другие участники отрасли. В частности, глава Anthropic Дарио Амодеи предупреждал о риске потери контроля над мощными моделями, а также об их возможном использовании для кибератак и биотерроризма. К международному сотрудничеству для ограничения рисков ИИ ранее призывал генеральный секретарь ООН Антониу Гутерриш.