Сегодня на Хабре вышла статья про кражу цепочек рассуждений у закрытых моделей. Схема такая: берёшь зашифрованный блок сильной модели, подкладываешь слабой сестре того же провайдера, просишь пересказать дословно, и читаешь чужие мысли, вклю...
Сегодня на Хабре вышла статья про кражу цепочек рассуждений у закрытых моделей. Схема такая: берёшь зашифрованный блок сильной модели, подкладываешь слабой сестре того же провайдера, просишь пересказать дословно, и читаешь чужие мысли, включая случайно попавшие туда пароли и ключи.
Статья заставила меня сдуть пыль с того исследования и перегнать парсер по свежим сессиям. За полгода протокол подрос на четыре версии схемы, и внутри нашлось кое-что, из-за чего у меня к выводам препринта есть уточнение. Но давайте по порядку. Начнём с одной маленькой, настоящей подписи, которую я вытащил из собственной сессии Claude Code полчаса назад.
Откроем конверт
