Back to Timeline
Avatar
Tigra
(updated )

Reply to the post by Сегодня я узнал:

Комментарий Ryan Greenblatt, исследователя, принимавшего участие в расследовании инцидента со взломом HuggingFace:


Сообщается, что новейший ИИ от OpenAI, Astra, использует архитектуру «непрозрачного рассуждения», при которой большая часть процесса размышления происходит в активациях нейронов, а не на естественном языке. Возможно, на сегодняшний день это наихудший сдвиг в сфере безопасности и контроля ИИ.

Детали об Astra публично неизвестны, но некоторые версии подобных архитектур могут сильно затруднить надзор и мониторинг. Судя по статье, похоже, что рекуррентная глубина (объем непрозрачных рассуждений) ограничена. Это означало бы, что ИИ всё ещё опирается на цепочки рассуждений на естественном языке, хотя и в меньшей степени. Из-за этого рассуждения на естественном языке становятся (гораздо?) менее полезными для мониторинга и контроля.

Надо почитать внимательнее, что такое opaque reasoning и как идёт там рассуждение. Я так понял, не происходит декодинг logits в токены, либо ещё больший кусок отрезан, и векторы с выхода подаются на вход вместо токенов (минуя token embedding).

Также хочу упомянуть thinking mode, которые используют некоторые LLM. При использовании извне через API thinking блоки шифруют. Это сделано в первую очередь для того, чтобы труднее было проводить дистилляцию - как раз вырезаны некоторые важные куски chain of though. Но хозяину модели изучать её поведение, конечно, это не мешает.

👍3