Малоизвестное интересное

Малоизвестное интересное 

Авторский канал Сергея Карелова

398subscribers

469posts

Showcase and bundles

265
A bundle is a collection, compilation, playlist, or catalog of posts that saves you from searching through the blog and lets you buy the entire content series in a single click.

ИИ можно вырастить как ребенка — в реальном хаосе мира

Поворот в ML: учим модели на "мусорных"
лайках вместо чистых оценок
Мы привыкли, что обучение
ИИ по человеческой обратной связи (RLHF) требует аккуратных, проверенных оценок людей-разметчиков. В реальности же
платформы — от соцсетей до медиа и маркетплейсов, — не выдают чистых ярлыков
“хорошо/плохо”: есть лишь шумные, смещённые сигналы (лайки, дочитывания, клики,
покупки), зависящие от контекста и масштаба аудитории.
Авторы нового метода обучения [1] предлагают
способ принять этот шум в работу, а не прятаться от него: учить модели на непроверенных,
реальных сигналах (RLNVR), но
при этом аккуратно вычищать системные перекосы и стабилизировать обучение.
Коротко говоря:

Бери сырой, шумный и бестолковый мир как он есть, нормируй очевидные
искажения, переноси сигнал по смысловому сходству и держи петлю обратной связи устойчивой.
Звучит гениально
просто. Осталось понять следующее.
1.     
Как это работает на практике (и почему это вообще возможно)?

Берём реальные, пусть и шумные, реакции людей; приводим их к честной шкале;
переносим опыт с лучших похожих случаев; и учим модель с простыми, но жёсткими
«поручнями», чтобы она не читерила.
2.     
Если
получится, - что это будет значить для общества и для каждого из нас?


Мир обратных связей
заговорит громче. Сильно упростится обучение моделей и повысится «демократизация
RL». Но может восторжествовать
«закон Гудхарта для ИИ».
3.     
Что
в сухом остатке


Предложен проект аккуратного
инженерного моста между сложной и непростой жизнью (напомню, - мой канал называется
@theworldisnoteasy😊) и петлями машинного обучения ИИ. Но мир
еще сложнее, и многое тут зависит уже не от кода, а от нас.



Теперь подробней
Как это работает на практике (и почему это вообще
возможно)
Несколько упрощая,
можно объяснить это простыми словами примерно так.
1) Выравниваем
«поле».


Сырые лайки и репосты нечестно сравнивать: у «звёзд» (инфлюенсеров, да и вообще
у любой медийной персоны) их по умолчанию больше. Поэтому сначала считаем не
«сколько собрал пост», а «насколько он лучше (или хуже) обычного для этого
автора». Пример: если у «звезды» обычно 1 000 лайков, а у новичка 20, то пост
звезды, начиная  с 1100 лайков, и пост
новичка с 40+ лайков — считаем оба «выше своей нормы». Так сигнал становится
сравнимым.
2) Ищем
«самого похожего двойника».


У нового текста нет будущего — мы не знаем, как он «зайдёт». Выход: ищем в
прошлом самый близкий по смыслу пост (например, о той же ссылке/теме) и берём
его результат как ориентир. Причём ориентируемся на лучшего из похожих: «делай
как самый удачный из на тебя похожих». Это позволяет учиться даже там, где
прямых тематических аналогов нет.
3) Ставим
«ограждения», чтобы модель не хитрила.


Как только даёшь метрику, её начинают «взламывать» — модель может уйти в
однообразные безопасные ответы или пустой кликбейт (закон Гудхарта и здесь не
спит). Поэтому в обучение вшивают простые страховки:
  • не поощрять повтор одного и того же
    текста;
  • слегка «привязывать» стиль к
    исходному (чтобы не унесло в спам);
  • время от времени «встряхивать»
    задачи, чтобы модель не залипала на одном трюке.
    Идея проста: повышаем качество, но не даём скатиться в дешёвые трюки.
4) Собираем
всё вместе в прототипе.


Авторы сделали «Walter» —небольшого
и умного автора коротких постов. Его учили на данных соцсети: считали
нормированный успех постов (репосты ценнее, затем ответы, затем лайки), искали
«смысловых двойников», брали у них лучший результат как подсказку и крутили
обучение с «ограждениями». На выходе — тексты стали живее и меньше пустых
хештегов.
5) Почему это
вообще работает.
  • В такой системе  есть хорошие «измерители смысла» —
    эмбеддинги: они позволяют надёжно находить похожие тексты.
  • Даже шумные поведенческие сигналы
    (лайки, дочитывания, репосты) всё же коррелируют с полезностью для людей —
    если их правильно нормировать.
  • «Страховки» в обучении держат систему
    в адекватном коридоре.
  • И главное: всё это уже можно
    запускать на обычном «железе» — не нужны дата-центры, значит подобные
    циклы обучения становятся доступными большим и маленьким командам.
Суммируя всё это
в одном предложении: берём реальные, пусть и шумные, реакции людей; приводим их
к честной шкале; переносим опыт с лучших похожих случаев; и учим модель с
простыми, но жёсткими «поручнями», чтобы она не читерила.
Если получится, что это значит для общества и для
каждого из нас
Мир обратных
связей заговорит громче.
Если
раньше многие модели подгонялись под вкусы разметчиков - людей, то теперь они смогут
учиться на наших реальных действиях в реальном мире социальных медиа — кликах,
дочитываниях, сохранениях, отказах… Не на идеале, а на практике. Такие контуры
машинного обучения, как у «Walter», легко переносятся на письма и заголовки, образовательные задания,
продуктовые тексты, исследовательские анонсы: везде, где есть хоть какой-то
(пусть шумный) сигнал результата.
Светлая
сторона.
Контент станет
понятней и адресней; инструкции — полезней; обучение — под темп ученика.
Появится «демократизация RL»:
такие цикла можно крутить на ноутбуке, не дожидаясь, когда и если это сделают
корпоративные ИИ-киты.
Тёмная
сторона.
Чем доступнее
такие петли, тем шире «менеджериальный взрыв» метрик: организации начнут
измерять и оптимизировать всё — не всегда к лучшему. Алгоритмы будут более настойчиво
преследовать метрику, а не смыслы (если мы не найдем способ их сдерживать). А
шумные социальные сигналы — системно смещены (эффект Матфея, случайность
времени, вкусы «эхо-камер»). Неправильно поставленная цель – это, по сути,
неправильная культура. И как следствие в алгокогнитивной культуре может восторжествовать
«закон Гудхарта для ИИ».
Что в сухом остатке
RLNVR — это не
очередной гигантский алгоритмический прорыв, а аккуратный инженерный мост между
сложной и непростой жизнью (напомню, что мой канал называется @theworldisnoteasy
😊) и петлями машинного обучения. Если на этом мосту
соблюсти правила — нормировать, переносить по смыслу, стабилизировать, не
давать «взламывать» — модели начнут учиться у нас без конвейера разметчиков.
Это значительно ускорит,
упростит и удешевит столь важный этап обучения моделей … Но и усилит все наши
слабости. Как и любой новый инструмент управления вниманием, RLNVR — это тест на зрелость инфраструктуры и
культурных норм. И тут многое зависит уже не от кода, а от нас.
#ИИ
#МашинноеОбучение
Subscription levels4

Бронзовая

$2.4$1.8 per month
-25%
billed every 12 months
Все посты в
текстовом и аудио форматах, плюс в начале каждого месяца обзор публикаций прошлого
месяца в форматах текстового ревью, аудио-пересказа и видео-презентации.

Серебряная

$5$3.7 per month
-25%
billed every 12 months
Всё как в
Бронзовой плюс лонгриды и эссе в двух форматах: текстовом и в аудио.

Золотая

$8.7$6.6 per month
-25%
billed every 12 months
Всё как в Серебряной
плюс чат обсуждений плюс доступ к участию в проводимых мною Zoom-лекциях и
Q&A семинарах (после подписки присылайте мне на @karelovs Ваш Username)

Алмазная

$12.5$9.4 per month
-25%
billed every 12 months
Всё как в Золотой
плюс эксклюзивный доступ к информарию канала - уникальные возможности в диалоге
с ИИ-мнемозиной канала получать в 8 форматах ответы по любой интересующей
теме/вопросу, плюс возможность проведения индивидуальных Q&A по материалам и темам публикаций (после подписки присылайте мне на @karelovs Ваш Username)
Go up