Сначала розетка, потом космос: скромный план по спасению ИИ от гигантомании
Мы ранее говорили о том, что нейронные сети можно научить мыслить понятиями, а не словами, предложили некоторые идеи для отслеживания причинно-следственных связей и обеспечения уверенности в верности выданного ответа, а также поняли, что подобные подходы могут радикально сократить требуемые вычислительные мощности. Но остался один очень важный нюанс - чтобы собрать базу типовых понятий, выяснить, какие характеристики и какая структура должна быть у них, нужно затратить титанические усилия. Конечно, предложенное в прошлых статьях решение с постепенным заполнением неизвестных данных и, соответственно, итеративным улучшением качества частично снимает эту проблему. Но не полностью.
Децентрализация добычи данных
Поскольку мы подразумеваем выделение конкретных “семантических осей”, по которым будут задаваться характеристики технических понятий, этот процесс может стать децентрализованным. Мы определяем правила игры, а затем даём возможность профильным институтам определять понятия для своей области. Далее они могут заливать это в единую базу, где хранятся все понятия из всех областей знаний. И такая задача, когда всю работу нужно выполнять не какой-то одной команде, а множеству разных коллективов по всему миру, уже не кажется неподъёмной. Своеобразная википедия для научного ИИ.
Поскольку все знания получаются в конкретных условиях, которые фиксируются в экспериментах, у каждого института есть возможность задать условия применимости их моделей и определений. Если приходит запрос на решение какой-то задачи, условия которой не соответствуют заданным, то система может дать корректный отказ, пояснив, что уверенности в результате нет. Либо, если пользователь принимает это, дать то, что получится.
Если поступает множество задач вне рамках изученных условий, это становится прямым сигналом о необходимости развития теории в конкретном направлении. Создаются заявки на исследования, автоматически фиксируются интересанты.
Экономия мощностей
Современные нейронные сети оперируют сотнями миллиардов параметров, что крайне ресурсозатратно. Если для каждой узкой задачи использовать малые модели, то и эта проблема исчезает. Для каждой области знаний значение имеют только заранее определённые переменные из конкретных областей науки. Если задача на стыке двух направлений, то берутся параметры из обоих. Сложность и затраты растут, но и задача нестандартная. И всё равно это гораздо проще, чем вертеть весь конвейер со всеми сотнями миллиардов параметров.
Выглядит всё гладко. На бумаге. Но как всё это внедрить и как вообще убедиться, что эта гипотетическая архитектура в принципе будет работать? Складывается ощущение, что это выльется в организацию огромной сложнейшей сети сотрудничающих институтов, формализации всех правил взаимодействия, постоянное совершенствование и изменение этих правил с учётом версий каждого из правил, что приведёт к коллапсу. Более того, даже без этой сети вся архитектура не подтверждена. Нет ни единого домена данных, где такой подход был бы проверен. А это исключительно важно сделать до того, как приступать к весьма сомнительному процессу реализации. Но решение есть.
От гипотезы к доказательству
Мы можем взять одно направление, которое изучено вдоль и поперёк, нагенерировать с помощью известных программных пакетов разных вариантов постановок задач, обучить модель и затем проверить, что всё работает. Всё это под силу сделать небольшой команде. Есть SPICE-симуляторы, которые фактически являются промышленным стандартом для уже неоднократно упомянутых мной в этом цикле статей электрических цепей. Покрыть эту одну относительно несложную область знаний можно вообще без проведения экспериментов и какого-то глубокого научного погружения.
Итак, план следующий:
1. Определить способы выделения семантических осей, применительно к расчёту электрических цепей.
2. Создать структуру сжатых семантических блоков (CST) для выбранной области науки и техники.
3. Сформировать архитектуру для работы с блоками причина-условия-следствие (CCC), контрактами для удовлетворения заданным условиям, а также явным заданием типов неопределённости.
4. Натренировать модель.
5. Протестировать.
6. Провести исследование по исключению “лишних” параметров, интерпретируемый смысл которых не получается определить.
Если после всего этого мы получаем одну область, где всё заработало, то можно смело приступать к масштабированию. И это откроет широчайшие возможности не только для технических наук, но и для развития ИИ в целом. Ведь если это заработало, то постепенно это получится адаптировать и на менее структурированные области.
Оригинальная научная статья, где изложена описываемая гипотетическая архитектура, находится здесь: https://zenodo.org/records/16901100