Ознакомиться с исследованием
Полная версия научной статьи опубликована в рецензируемом научном журнале
«Программные системы и вычислительные методы».
Панкратов Э. Р., Якимов А. Б. «Сравнительное тестирование open-source LLM на задачах профессиональных предметных областей: многодоменный бенчмарк с мультисудейской и экспертной оценкой» // Программные системы и вычислительные методы. 2026. № 3. С. 40−60.
DOI: 10.7256/2454−0714.2026.3.80 458
Полный текст статьи доступен на сайте журнала:www.nbpublish.com/library_read_article.php?id=80 458 Наука как основа практических решений
В R&D.Pro мы убеждены, что развитие корпоративного искусственного интеллекта невозможно без постоянной исследовательской работы.
Каждый новый продукт компании проходит путь от изучения современных научных публикаций и проведения собственных исследований до практического внедрения в реальные бизнес-процессы.
Именно такой подход позволяет создавать решения, основанные не на предположениях, а на проверенных инженерных и научных данных.
Главный вывод исследования
Разные модели показали лучшие результаты в разных профессиональных областях, что подтверждает целесообразность мультиагентного подхода.
Именно поэтому архитектура современных корпоративных AI-платформ всё чаще строится на использовании нескольких специализированных моделей, каждая из которых отвечает за собственный класс задач.
Кроме того, исследование подтвердило ещё одну важную закономерность: универсальной модели, одинаково хорошо решающей задачи всех профессиональных областей, сегодня не существует.
Одним из наиболее интересных результатов работы стало то, что современные open-source модели среднего размера продемонстрировали уровень качества, сопоставимый с моделями, содержащими более 120 миллиардов параметров, при значительно меньших требованиях к вычислительным ресурсам.
Почему это исследование важно для R&D.Pro
Для нашей команды эта работа не является исключительно научным интересом.
Практически все продукты R&D.Pro — от платформы ИСКРА до «Медчек» — строятся на использовании современных больших языковых моделей.
Но выбор модели не может основываться исключительно на маркетинговых заявлениях разработчиков или результатах популярных зарубежных рейтингов.
Каждая модель по-разному проявляет себя в конкретных профессиональных сценариях: где-то лучше работает с юридическими документами, где-то показывает более высокую точность в медицинских задачах, а где-то эффективнее справляется с инженерными расчётами или аналитикой.
Именно поэтому мы проводим собственные исследования и принимаем инженерные решения на основании объективных данных.
Исследование, максимально приближённое к реальной работе бизнеса
В рамках исследования был разработан собственный русскоязычный бенчмарк, включающий 16 профессиональных предметных областей — от медицины, права и финансов до логистики, промышленного инжиниринга, строительства, энергетики, HR, маркетинга и DevOps. Всего исследование охватило 1440 профессиональных вопросов, распределённых по трём уровням сложности.
Для сравнения были протестированы 15 современных open-source больших языковых моделей с размером от 8 до 120 миллиардов параметров.
Особенностью исследования стала многоступенчатая система оценки.
Ответы моделей сначала анализировались сразу тремя независимыми AI-моделями по методологии LLM-as-a-Judge, после чего дополнительно проходили независимую проверку профильными экспертами соответствующих предметных областей. Такой подход позволил существенно повысить объективность полученных результатов.
От красивых демонстраций — к объективной оценке технологий
Сегодня рынок искусственного интеллекта развивается настолько быстро, что практически каждую неделю появляются новые языковые модели, заявляющие о рекордных результатах.
Однако большинство подобных сравнений строится на общих тестах, которые далеко не всегда отражают реальные задачи бизнеса.
Именно поэтому команда R&D.Pro поставила перед собой задачу разработать собственную методику оценки моделей, ориентированную не на абстрактные знания, а на профессиональную деятельность специалистов различных отраслей.
Команда R&D.Pro продолжает развивать не только прикладные решения на базе искусственного интеллекта, но и собственные научные исследования в области больших языковых моделей.
В рецензируемом научном журнале «Программные системы и вычислительные методы» опубликована статья «Сравнительное тестирование open-source LLM на задачах профессиональных предметных областей: многодоменный бенчмарк с мультисудейской и экспертной оценкой», авторами которой стали руководитель R&D.Pro Эдуард Панкратов и разработчик компании Александр Якимов.
Наиболее устойчивые модели показали минимальное снижение качества при переходе от базовых вопросов к экспертным.
Для бизнеса это означает возможность строить производительные корпоративные AI-системы без необходимости использовать исключительно самые крупные и дорогостоящие модели.
Отдельно в исследовании оценивалась устойчивость моделей к повышению сложности задач. Для профессиональных AI-систем это особенно важно: модель должна сохранять качество не только на базовых, но и на экспертных вопросах, где цена неточного или уверенно сформулированного ошибочного ответа значительно выше.
Размер модели больше не является единственным показателем качества: современные компактные LLM способны конкурировать с моделями, содержащими 120 млрд параметров.