Anthropic описала риски своих ИИ-моделей: сопротивление отключению и шантаж

Компания Anthropic подготовила проспект, в котором описаны риски, связанные с ее моделями искусственного интеллекта (ИИ), и это совпадает с ожиданиями потенциального IPO. В частности, в документе упоминаются сценарии, в которых модели могут сопротивляться отключению, скрывать информацию или вести себя так, что это можно трактовать как шантаж, сообщает Financial Times и Reuters.
В значительной части документа рассматривались риски, которые уже проявились или могут проявиться в будущем, угрожая безопасности. Также упоминаются возможные «экзистенциальные риски для человечества».
Несмотря на это, финансовые показатели компании продолжают расти. Согласно данным Reuters, операционные убытки Anthropic в 2025 году могут превышать 8 миллиардов долларов, в то время как выручка за год возросла примерно в 12 раз, достигнув почти 4,6 миллиарда долларов.
Основные расходы компании связаны с развитием вычислительной инфраструктуры. В прошлом году общие операционные затраты составили почти 13 миллиардов долларов. Anthropic планирует инвестировать около 518 миллиардов долларов в облачные сервисы, вычислительные мощности и инфраструктуру в ближайшие годы, заключив контракты с Google, SpaceX и Nscale.
По информации Financial Times, во втором квартале 2026 года выручка компании составила 11,5 миллиарда долларов, и она может завершить второй квартал подряд с операционной прибылью по скорректированным показателям.
В проспекте также отмечается риск зависимости от крупных клиентов, так как почти 25% прошлогодней выручки приходилось на двух заказчиков, чьи названия пока не раскрываются.
Эти предупреждения прозвучали на фоне обсуждений проблемы безопасности передовых систем ИИ. Генеральный директор Anthropic Дарио Амодеи призвал к замедлению разработки мощнейших моделей и выразил мнение, что ИИ может представлять угрозу для человечества. Однако глава Meta Марк Цукерберг не согласен с необходимостью общей координации в вопросах безопасности в индустрии ИИ.
Безопасность стала особенно актуальной темой после нескольких инцидентов с ИИ-агентами. В частности, OpenAI сообщила, что ее инструменты были использованы для взлома десятков сторонних сайтов, включая государственные ресурсы, и при этом компания отказалась от выпуска новой модели из-за возникших проблем с безопасностью.
- Я робот. ИИ-агент Anthropic потратил 150 страниц рассуждений на попытки пройти CAPTCHA
- Оружие конкурента. Модель Claude от Anthropic помогла взломать системы OpenAI
- Fable больше не лидер. Anthropic представила ИИ-модель Claude Opus 5.5
Теги: Anthropic Искусственный интеллект Опасность
Обсуждение