SGHA: полностью автономный поиск научных пробелов на локальной LLM без внешних API

28 августа 202612 просмотров

Новая система превращает массив статей в структурированный граф доказательств и с помощью открытой модели с 9 млрд параметров находит нерешённые исследовательские задачи. Подход повышает прозрачность процесса, снижает риски галлюцинаций и не требует передачи данных во внешние сервисы.

SGHA: полностью автономный поиск научных пробелов на локальной LLM без внешних API

Введение: почему ИИ-учёные застревают на старте

Современные языковые модели научились неплохо справляться с рутиной научной работы: они генерируют гипотезы, пишут код для экспериментов и даже оформляют черновики статей. Однако при попытке автоматизировать весь цикл исследования возникает неожиданное узкое место — ранний этап, на котором нужно сформулировать саму исследовательскую проблему.

Большинство существующих ИИ-учёных на этом шаге обращаются к коммерческим API проприетарных моделей. Это похоже на чёрный ящик: предложения появляются из параметрических знаний модели и поиска литературы, который заранее подстроен под сгенерированные идеи. Проверить, на каких фактах основан вывод, практически невозможно. Добавьте сюда риск галлюцинаций и систематических смещений конкретной модели — и получится, что исходная точка исследования может быть не просто случайной, а необоснованной.

Отдельная боль — приватность. Учёные не всегда готовы отправлять свои наработки во внешние API, особенно если речь о незапатентованных идеях или чувствительных темах. Поэтому неудивительно, что всё больше внимания привлекают локальные подходы, которые не покидают пределы исследовательской инфраструктуры.

Именно здесь на сцену выходит система SGHA, разработанная Сарвешем Гхаратом и Дзюмпеем Комиямой. Их препринт появился в архиве 18 августа 2026 года. Авторы предлагают полностью автономный пайплайн обнаружения научных пробелов, работающий на локальной открытой модели без единого обращения к внешним API. Но давайте разберёмся, как она устроена.

Как устроена SGHA: от корпуса к исследовательским проблемам

В отличие от типичных агентов, которые просто «думают» в свободной форме, SGHA делает ставку на явную структуру научного корпуса. Первый этап — превращение массива статей в объекты статей, связанные с доказательствами, и типизированный граф доказательств. Если упрощённо, каждая публикация раскладывается на сущности и связи: какие утверждения она делает, на какие работы опирается, какие эксперименты подтверждают выводы.

Затем система ищет в этом графе нерешённые структурные паттерны — потенциальные пробелы. Это не просто текстовые совпадения, а проверяемые на фактическом материале «дыры»: например, две области исследований явно связаны, но никто не пробовал их объединить. Важно, что каждый кандидатный пробел перед тем, как стать полноценной постановкой задачи, проходит проверку на состоятельность.

От паттернов к семействам проблем

На выходе SGHA создаёт семейства исследовательских проблем, по каждой из которых указано:

  • допущения;
  • цели;
  • критерии успеха;
  • оставшиеся неоднозначности.

Такой подход позволяет исследователю видеть не просто идею, а её обоснование и границы применимости. При этом все рассуждения ограничены доказательствами из корпуса, что резко снижает вероятность галлюцинаций.

Полностью локально: только открытая модель на 9 млрд параметров

Ключевая особенность SGHA — полная автономность. Все компоненты, связанные с обработкой языка и рассуждением, выполняются на локально развёрнутой открытой модели с 9 миллиардами параметров. Никаких проприетарных API фронтовых моделей, никакой передачи данных наружу. Даже длительный исследовательский процесс не потребует ни одного внешнего запроса.

Это не просто вопрос удобства. Для лабораторий, работающих с индустриальными заказами или медицинскими данными, такой подход снимает целый класс проблем с управлением данными и конфиденциальностью. К тому же открытая модель на 9B — это достаточно скромный размер по современным меркам, что делает систему доступной для запуска на одной мощной рабочей станции.

Оценка: сравнение с AI Scientist-v2

Авторы проверили систему в пяти областях машинного обучения, сравнивая её с модулем формулирования идей из проекта AI Scientist-v2. Результаты показывают, что подход с явной структурой корпуса и проверкой доказательств даёт не менее перспективные и проверяемые формулировки проблем, чем при использовании гораздо более мощных фронтовых моделей. SGHA не просто генерирует названия тем, а позволяет проследить, на основании каких статей и связей она пришла к той или иной постановке вопроса.

Это решает проблему «чёрного ящика» и делает процесс аудируемым. А учитывая полную локальность, такого агента можно легко встроить в научные рабочие процессы, не беспокоясь о политике безопасности.

Выводы и перспективы

SGHA — убедительный пример того, что для постановки научных задач не обязательно подключать гигантские облачные модели. Структурирование корпуса, граф доказательств и локальная модель на 9B способны обеспечить качество, достаточное для перспективных и проверяемых исследовательских проблем. Конечно, впереди ещё много работы: авторы обещают открыть код и артефакты, что позволит другим группам воспроизвести результаты и адаптировать систему под свои области.

Если тренд сохранится, в ближайшие годы мы увидим целый класс ИИ-учёных, которые не зависят от внешних API и полностью прозрачны для проверки. А значит, автоматизация науки станет не только эффективнее, но и безопаснее.

Часто задаваемые вопросы

Похожие материалы

Все материалы
SGHA — автономный поиск научных пробелов на локальной LLM