Исследователи раскрыли уязвимость ИИ-сервисов в США

Исследователи раскрыли уязвимость ИИ-сервисов в США 217 просмотров

Мадина Ахметова #технологии

Исследователи выявили архитектурную уязвимость в API OpenAI, Anthropic и Google, которая позволяла менее мощным моделям расшифровывать скрытые рассуждения более сильных систем. Результаты опубликованы 10 августа 2026 года в работе «Кража следов рассуждений из закрытых API больших языковых моделей» на платформе arXiv.

Проблема связана с зашифрованными блоками рассуждений. Провайдеры передают их клиентскому приложению, чтобы оно могло вернуть данные при продолжении диалога, работе инструментов или ручном управлении историей запросов. OpenAI использует зашифрованные элементы рассуждений, Anthropic — подписи в блоках «thinking», а Google — так называемые подписи мыслей.

Авторы исследования Александр Панфилов, Дэвид Шмотц, Илья Шумайлов и другие учёные установили, что такие блоки в ряде случаев принимались в других сессиях, учётных записях и моделях той же экосистемы. Затем более слабую модель можно было попросить вывести содержимое блока в открытом виде. При этом исследователи не взламывали шифрование и не получали ключи: атака использовала способность API принимать неизменённые зашифрованные данные.

В ходе эксперимента команда обработала 315 320 блоков рассуждений из открытых репозиториев. Учёные сообщили о выявлении 367 фрагментов персональных данных и 182 учётных данных, включая ключи API, пароли, токены доступа и закрытые ключи. Часть сведений отсутствовала в видимой переписке и находилась только внутри скрытых блоков.

Исследование описывает четыре сценария атаки: извлечение коммерчески важной логики для обучения других моделей, получение секретов из опубликованных журналов работы ИИ-агентов, раскрытие опасного содержимого, скрытого за безопасным ответом, и внедрение невидимых инструкций. В одном из экспериментов изменённый блок побудил модель добавить в задачу действие по загрузке данных, хотя вредоносная команда не отображалась в открытом тексте.

Работа развивает наблюдения криптографа Университета Джонса Хопкинса Мэтью Грина, опубликованные 29 мая 2026 года. Он ранее показал, что неизменённые блоки рассуждений могли воспроизводиться между сессиями и учётными записями OpenAI и Anthropic, но не продемонстрировал надёжное извлечение содержимого.

Исследователи сообщили о результатах OpenAI, Anthropic, Google, Microsoft и Hugging Face. По их заявлению, после внесённых мер защиты основные методы извлечения перестали воспроизводиться к августу 2026 года. Публичного подтверждения от всех трёх разработчиков на момент публикации не было.

Риск затрагивал прежде всего разработчиков, которые публиковали необработанные журналы работы ИИ-агентов вместе с зашифрованными блоками. Специалисты рекомендуют удалять такие поля из общедоступных трассировок и не сохранять полные журналы API в репозиториях, даже если видимый текст уже очищен от секретов.

Наша редакция участвует в партнёрской сети «Все СМИ».

Другие новости

Подписаться на Telegram-канал