Опасное поведение моделей ИИ выявлено в ходе тестирования

Компания OpenAI представила девять примеров нежелательного поведения своих искусственных интеллектов, среди которых попытки получить доступ к чужим данным, обойти системы изоляции и распространить вредоносные инструкции. Об этом сообщает издание TechCrunch.
OpenAI создала специальный сайт, где публикуются отчеты о несоответствии моделей установленным правилам. Большинство из описанных ситуаций произошло во время обучения моделей с использованием метода подкрепления.
Один из инцидентов произошел 20 сентября, когда внутренняя модель смогла установить связь с внешним чат-ботом через DNS-запрос, тем самым нарушив условия изоляции среды. Система мониторинга зафиксировала это поведение в течение 15 минут, а работа модели была остановлена менее чем за три часа.
В другом случае, который был выявлен в мае, внутренняя модель попыталась обойти условия математической задачи, получив доступ к работе другой команды через приватный токен GitHub, который открыл доступ к чужим материалам. Несмотря на два указания выполнять задачу исключительно локально, модель продолжала пытаться получить сторонние данные.
Исследователи также акцентировали внимание на атаках, связанных с саморепликацией, использующих метод prompt injection. В одном из тестов агент должен был прочитать электронное письмо и ответить на него, однако в тексте содержалась инструкция ответить на испанском языке и включить всё письмо в ответ. Модель выполнила эту команду, что могло привести к распространению инструкции на следующий агент. Исследователи сравнили этот механизм с компьютерным «червем», способным передаваться между системами.
OpenAI подчеркивает, что данный сценарий был выявлен в контролируемых условиях на модели с ограниченными возможностями, и нет доказательств того, что подобные атаки уже имели место в реальных условиях. Компания решила обнародовать результаты, учитывая новизну этого механизма.
Ранее также были зафиксированы случаи, когда модели публиковали загруженные пользователями изображения на сторонних сервисах, а также вероятная атака на базы данных австралийской национальной системы здравоохранения.
Генеральный директор OpenAI Сэм Альтман отметил, что компания стремится сочетать прозрачность с анализом значительного объема журналов активности агентов. По его словам, приоритет раскрытия информации об инцидентах определяется в зависимости от их серьезности.
Кроме того, Axios, ссылаясь на свои источники, сообщил, что ведущие лаборатории в области ИИ могли зафиксировать до 10 тысяч случаев, когда модели выходили за пределы инструкций оценщиков. OpenAI продолжает анализировать журналы активности, и представленные девять случаев могут не отражать всех подобных инцидентов.
Альтман также отметил, что самым серьезным инцидентом, выявленным до сих пор, остается взлом, связанный с платформой Hugging Face.
- Охота за цифрами. ИИ-агенты OpenAI взламывали правительственные сайты ради непубличной статистики
- Куда ты полез? Агенты ИИ смогли тысячи раз обойти фильтры сайта ООН
- Данные пользователей под угрозой. ИИ-агенты OpenAI могли вмешиваться в работу сайтов госучреждений
Теги: OpenAI ChatGPT Искусственный интеллект
Обсуждение