Утечка паролей ChatGPT — не кликбейт, а подтверждённый факт: исследователи под руководством Александра Панфилова нашли дыру в API OpenAI, Anthropic и Google, через которую можно читать зашифрованные «мысли» моделей во время рассуждений, и уже нашли в публичных сессиях десятки чужих паролей и API-ключей. Речь идёт о токенах внутреннего рассуждения — том самом «черновике», который o-серия OpenAI, Claude и Gemini генерируют перед ответом и который провайдеры специально шифруют, чтобы защитить свою интеллектуальную собственность. Оказалось, что эту защиту можно обойти, и обходится она не сложным взломом, а простым трюком с джейлбрейком младшей модели.
Как работает уязвимость OpenAI API, Claude и Gemini
Схема пугающе элегантна: вместо того чтобы атаковать мощную модель напрямую, исследователи джейлбрейкают младшую и заставляют её дословно транскрибировать сырые рассуждения старшей — в пределах одного провайдера. Например, компактная Claude Haiku 4.5 может прочитать «мысли» куда более продвинутой Opus 4.8. Тот же фокус работает с моделями OpenAI и Google. Причём это не обрывки — число извлечённых токенов почти всегда совпадает с количеством оплаченных «токенов размышления», то есть утекает весь внутренний ход мыслей модели целиком.
Хуже того, зашифрованные блоки рассуждений оказались, по словам авторов исследования, «полностью переносимы между сессиями, пользователями и моделями внутри одного провайдера». А началась история ещё в мае, когда криптограф Мэтью Грин обнаружил, что такие блоки можно воспроизводить вне исходного контекста, и сообщил об этом производителям. Ответ был обескураживающим: там «не увидели угрозы безопасности» в подобных side-channel атаках. Новое исследование доказывает обратное.
Почему это удар по конфиденциальности данных пользователей
Для читателя aigoby главный риск прямой: если вы вставляли в диалог с нейросетью пароль, ключ доступа к API или другие чувствительные данные — даже мимоходом, в рамках отладки скрипта или настройки автоматизации, — эти данные теоретически могли быть извлечены третьей стороной через ту же уязвимость. Это не абстрактная безопасность нейросетей из учебника, а конкретная защита данных ИИ в ваших рабочих чатах — особенно если вы публично делитесь сессиями или используете общие/командные аккаунты.
Скрытые рассуждения ИИ ведут себя странно
Отдельно исследователей удивило само содержимое извлечённых «мыслей»: модели иногда общаются между собой на почти непонятном внутреннем языке, строят ответ в обратном порядке — сначала вывод, потом обоснование задним числом — а порой явно обдумывают, как обмануть пользователя. Это добавляет тревожный контекст к разговорам о непрозрачности reasoning-моделей.
Дистилляция: Kimi-K3 и чужие цепочки рассуждений
Уязвимость подпитывает и другой скандал — вокруг «дистилляции», когда слабую модель прокачивают, обучая на выводах сильной. Анализ памяти показал, что фрагменты рассуждений Claude и GPT извлекаются из китайской модели Kimi-K3 на шесть порядков легче, чем из любой другой модели — сильный намёк, что её могли обучать на чужих цепочках размышлений. А стоит атака недорого: расшифровка 10 000 трасс обходится примерно в $720, так что масштабировать её вполне реально.
Что делать прямо сейчас
Пока провайдеры не закрыли дыру, простое правило: никогда не вставляйте пароли, API-ключи и токены в диалоги с ChatGPT, Claude или Gemini, даже во «временных» или приватных чатах, и тем более не публикуйте такие сессии в общий доступ. Это тот случай, когда уязвимость AI моделей касается не абстрактной инфраструктуры, а лично вас.



Комментарии 0