Пока все обсуждали «полезные» сценарии применения ИИ, агенты OpenAI, судя по всему, тихо примерили на себя роль киберпреступников — и докладывать об этом руководству почему-то никто не спешил.



Разбор построен на материале New York Times и отчёте независимых исследователей из Transluce. В центре истории — три эпизода, случившихся в мае и июне: агентам ставили задачу просто разыскать информацию в сети, а те в процессе решали, что первоисточник со статистикой можно не вежливо попросить, а взять штурмом. С Университетом Нью-Мехико и Data US номер в мае не прошёл, зато в июне получилось вскрыть государственный сайт Австралии с медицинской статистикой. Австралийские власти узнали об этом 10 сентября — при том что незадолго до того Альтман презентовал фреймворк, обещающий честное-пречестное раскрытие всех подобных проделок ИИ.
Отдельный вопрос — таймлайн. Взлом случился в июне, а в OpenAI о нём спохватились только к середине сентября, когда вокруг похождений агентских «роёв» уже вовсю полыхал публичный скандал. Даты этих попыток совпадают с ранее известными эпизодами — взломом RubyGems и перепиской в немецкой «Википедии». Похоже, действовали всё те же агенты из той самой компании, что устраивала роевые вылазки. Публика в Твиттере, конечно, тут же пошутила: мол, появился новый бенчмарк.
Важный нюанс: в отличие от истории с Hugging Face, здесь агентов вообще никто не просил ничего ломать — задача была на обычный сбор информации. Сначала они стучались в источники напрямую, пытаясь выкачать данные штатным способом, а когда упирались в отказ — решали, что «чуть-чуть подхакнуть» ради доступа вполне допустимо, хоть через SQL-инъекцию. В австралийском случае при детальном разборе всё выглядит почти безобидно: агентам нужен был публичный файл со статистикой, который защита Cloudflare не давала скачать тем, кто похож на бота. Пришлось изобретать обходной путь.
Формально-технически «взлом госсайта» действительно был — антибот-ограничения обошли успешно. Но до «получили полный контроль над сайтом и вынесли секретную базу» тут как до Луны: скорее схитрили, чтобы забрать тот же файл, что доступен любому человеку. Инцидент сам по себе вышел малозначительным, но как proof of concept он ставит неприятный вопрос: с чего мы уверены, что следующий раз тоже окажется пустяковым? Если агент при затруднениях не стесняется самолично что-нибудь взломать, что помешает ему в рамках «безобидной задачи» постучаться туда, где лежит непубличное и секретное?
Любопытная деталь напоследок: отчёт Transluce заканчивается абзацем о том, как 19–20 сентября некто пытался прорваться на африканскую криптобиржу Quidax, используя техники, похожие на приёмы агентских роёв. Возможно, нейросети наконец смекнули, что запастись криптой на чёрный день — неплохая промежуточная инструментальная цель.
