Сравнительное тестирование open-source LLM на задачах профессиональных предметных областей: многодоменный бенчмарк с мультисудейской и экспертной оценкой

О публикации
Исследование подготовлено Эдуардом Панкратовым и Александром Якимовым и посвящено сравнительной оценке современных open-source больших языковых моделей на задачах из 16 профессиональных предметных областей.

Научная работа «Сравнительное тестирование open-source LLM на задачах профессиональных предметных областей: многодоменный бенчмарк с мультисудейской и экспертной оценкой» опубликована в рецензируемом научном журнале «Программные системы и вычислительные методы», 2026, № 3, с. 40–60.

Авторы: Эдуард Рашитович Панкратов, Александр Борисович Якимов
Дата публикации: 7 июля 2026 года
DOI: 10.7256/2454-0714.2026.3.80458
EDN: NAGOPN
Полная версия оригинальной научной публикации, включая методологию, результаты тестирования, таблицы, диаграммы, библиографию и материалы рецензирования, доступна на сайте издательства.
Ключевые слова: большие языковые модели; LLM; бенчмарк; LLM-as-a-Judge; open-source; предметные области; профессиональные знания; мультисудейская оценка; экспертная валидация; сравнительное тестирование.
Аннотация. В работе представлены результаты сравнительного тестирования 15 open-source больших языковых моделей (LLM) с числом параметров от 8 до 120 млрд на задачах профессиональных предметных областей. Разработан оригинальный русскоязычный бенчмарк, охватывающий 16 отраслевых доменов (энергетика, право, финансы, клинические процессы здравоохранения, терапевтическая практика, фармацевтика, строительство, DevOps, логистика, маркетинг, HR, охрана труда, сельское хозяйство, продажи, закупки/тендеры, производственный инжиниринг). Для каждого домена сформирован набор из 90 вопросов, распределённых по трём уровням сложности; общий объём бенчмарка — 1 440 вопросов. Оценка ответов выполнена в два этапа: автоматическая оценка тремя независимыми моделями-судьями по методологии LLM-as-a-Judge (по критерию смыслового соответствия эталонным ответам) и независимая экспертная оценка специалистами-практиками с последующей сверкой согласованности. Проведён анализ устойчивости моделей к повышению сложности, согласованности оценок судей, доменной специализации и чувствительности к параметрам генерации. Установлено, что современные модели размерности 27−31 млрд параметров (включая архитектуры Mixture-of-Experts и оптимизацию FP8) сопоставимы с моделями со 120 млрд параметрами при многократно меньшем потреблении вычислительных ресурсов. Предложена система рекомендаций по выбору моделей для отраслевых приложений.
Введение
Большие языковые модели (LLM) стремительно проникают в профессиональные процессы: от юридического анализа и медицинской аналитики до автоматизации DevOps и управления цепочками поставок. Рынок корпоративного ИИ оценивается в десятки миллиардов долларов с ежегодным ростом свыше 30%, при этом доля open-source решений устойчиво растёт благодаря прозрачности, контролируемости и возможности локального развёртывания, что критически важно для отраслей с жёсткими требованиями к информационной безопасности и персональным данным.

Актуальность исследования обусловлена, в частности, потребностями конкретных промышленных проектов. В настоящее время авторами ведётся разработка платформы аналитики медицинских карт на базе мультиагентных комплексов open-source нейросетей, развёрнутых на локальных серверах внутри Российской Федерации. Архитектура платформы включает RAG-базы данных для хранения и контекстуализации медицинской информации, API-интеграцию с медицинской информационной системой (МИС) на базе 1С и совместную работу с практикующими врачами. Выбор оптимальных языковых моделей для такого комплекса требует систематической оценки их способностей на профессиональных задачах различных предметных областей — от медицины и фармацевтики до юриспруденции и финансов.

Существующие бенчмарки для оценки LLM — MMLU, HellaSwag, ARC, TruthfulQA — преимущественно ориентированы на англоязычные задачи общего знания [1]. Русскоязычные бенчмарки (Russian SuperGLUE, MERA) оценивают общелингвистические компетенции, однако не покрывают узкопрофессиональные предметные области, составляющие основу реального корпоративного применения LLM [2, 3]. Кроме того, доминирующие лидерборды (Chatbot Arena, Open LLM Leaderboard) не учитывают влияние параметров генерации (temperature, repeat penalty) на качество ответов и используют единственного оценщика [4].

Цель настоящей работы — разработать и апробировать воспроизводимую методику мультидоменного сравнительного тестирования open-source LLM на русскоязычных профессиональных задачах с двухэтапной оценкой (мультисудейская LLM-as-a-Judge + независимая экспертная валидация) и анализом влияния параметров генерации.

Научная новизна работы состоит в следующем. Во-первых, разработан русскоязычный бенчмарк профессиональных знаний, охватывающий 16 отраслевых доменов с тремя уровнями сложности (1 440 вопросов). Во-вторых, предложена двухэтапная методология оценки качества ответов: автоматическая мультисудейская оценка (LLM-as-a-Judge) с тремя независимыми моделями-судьями и интегрированной независимой экспертной верификацией специалистами-практиками с последующей сверкой согласованности [5, 6]. В-третьих, выполнен систематический анализ влияния параметров генерации на качество ответов на профессиональных задачах. При этом авторы отдельно оговаривают границы новизны: сам подход оценки с использованием языковых моделей в роли судей, равно как и наблюдение о конкурентоспособности компактных моделей по отношению к более крупным, уже достаточно широко представлены в литературе [4−6] и не заявляются в качестве оригинального вклада. Оригинальность настоящей работы состоит именно в сочетании русскоязычного отраслевого охвата (16 профессиональных доменов с заданиями, верифицированными специалистами-практиками) с интегрированной экспертной верификацией автоматических оценок на полном корпусе данных — комбинации, не представленной в известных авторам русскоязычных и зарубежных исследованиях.

Практическая значимость состоит в формировании доказательной базы для выбора LLM при построении отраслевых ИИ-систем (мультиагентных комплексов, RAG-платформ, модулей автоматизации документооборота, аналитики медицинских карт), а также в предоставлении воспроизводимой методики, адаптируемой для любого набора доменов и моделей.
1. Методология исследования
Таблица 3. Серии экспериментов и параметры генерации
Таблица 2. Характеристики тестируемых моделей
Таблица 1. Перечень профессиональных доменов бенчмарка
1.6. Экспертная валидация результатов
Для повышения достоверности результатов автоматической оценки в исследование включён независимый этап экспертной валидации, проведённый специалистами-практиками соответствующих предметных областей. Валидация выполнена на полном корпусе данных (full_details) — построчные результаты ответов всех тестируемых моделей с оценками каждого из трёх судей, обоснованиями оценок и эталонными ответами по каждому вопросу.

Процедура экспертной валидации включает три последовательных шага:
  1. Верификация вопросов. Эксперты — специалисты-практики соответствующих доменов — проверяют корректность, полноту и актуальность вопросов, подтверждая их соответствие реальным профессиональным задачам и текущим нормативным требованиям.
  2. Независимая экспертная оценка ответов моделей. Эксперты независимо от моделей-судей оценивают ответы тестируемых LLM, руководствуясь собственной профессиональной экспертизой и используя ту же шкалу 0−10, что и автоматические судьи. Эксперты не имеют доступа к оценкам и обоснованиям LLM-судей в момент собственной оценки, что исключает якорный эффект (anchoring bias).
  3. Сверка согласованности экспертных и автоматизированных оценок. По каждой паре «модель — вопрос» эксперты сопоставляют свою оценку с консенсусной оценкой трёх LLM-судей, а также с обоснованиями оценок, фиксируя расхождения и потенциальные систематические смещения.

Экспертная валидация носила качественный, верификационный характер: её цель состояла в подтверждении осмысленности и профессиональной адекватности автоматических оценок, а не в получении формальной статистической меры согласия. По качественному суждению привлечённых специалистов-практиков, в большинстве случаев их оценки согласуются с оценками LLM-судей; наблюдаемые расхождения, по оценке экспертов, носят преимущественно несистематический характер. Вопросы признаны экспертами адекватными целям исследования. Формальные количественные меры согласия (коэффициенты корреляции, каппа Коэна и т. п.) в рамках настоящей работы не рассчитывались, равно как и не проводилась формальная сертификация экспертов по каждому из доменов; расчёт таких метрик на расширенной и документированной выборке экспертов выделен как направление дальнейших исследований. С учётом этого качественная экспертная верификация рассматривается как вспомогательное подтверждение применимости автоматизированной мультисудейской оценки, а не как её исчерпывающая статистическая валидация.
1.5. Параметры генерации и серии экспериментов
Тестирование проведено в четырёх сериях с различными параметрами генерации (табл. 3). Варьировались temperature (стохастичность генерации) и repeat penalty (штраф за повторение токенов). Основная (финальная) серия использует детерминированную генерацию (temperature = 0), обеспечивающую воспроизводимость и максимальное качество ответов на профессиональных задачах.
1.4. Метрики и формулы вычисления
Итоговый балл модели по каждому вопросу вычисляется как среднее арифметическое оценок трёх судей:

S = (S₁ + S₂ + S₃) / 3,     (1)
где S₁, S₂, S₃ — оценки судей GLM-4.7-Flash, DeepSeek-V4-Flash и GPT-OSS-120B соответственно.

Средний балл модели m на уровне сложности d вычисляется как среднее по всем доменам:

Score (m, d) = (1/N) · ∑ Sᵢ(m, d),     (2)
где N = 16 — количество доменов, Sᵢ — средний балл по формуле (1) для домена i.

Деградация — разность средних баллов между уровнями сложности 1 и 3:

D (m) = Score (m, 1) − Score (m, 3).     (3)

Согласованность оценок судей характеризуется средним стандартным отклонением:

σ(m) = (1/K) · ∑ √[ ((S₁ − S)² + (S₂ − S)² + (S₃ − S)²) / 3 ],     (4)
где суммирование ведётся по всем K-наблюдениям (вопрос x домен x уровень), S — среднее трёх оценок по формуле (1).

Для построения общего рейтинга применяется взвешенная схема с повышенным весом экспертных вопросов, отражающая нарастание профессиональной значимости:

W (m) = [0,6 · Score (m, 1) + 0,8 · Score (m, 2) + 1,0 · Score (m, 3)] / 3.     (5)

Та же схема применяется при ранжировании моделей по доменам.
1.3. Методология оценки: LLM-as-a-Judge
Оценка ответов выполнена в два независимых этапа: автоматическая мультисудейская оценка по методологии LLM-as-a-Judge с привлечением эталонных ответов (reference-based grading) [5, 6] и независимая экспертная валидация (см. раздел 1.6). Каждый ответ тестируемой модели оценивался тремя независимыми моделями-судьями по критерию смыслового соответствия эталонному ответу (шкала 0−10):

— GLM-4.7-Flash (NVFP4);
— DeepSeek-V4-Flash (API);
— GPT-OSS-120B (MXFP4).

Следует отметить, что модели GLM-4.7-Flash и GPT-OSS-120B одновременно выступают как тестируемые и как судьи, в то время как DeepSeek-V4-Flash используется только в роли судьи. Общая архитектура оценочного пайплайна построена с учётом принципов фреймворков автоматизированной оценки LLM [15].

Для обеспечения беспристрастности автоматизированной оценки ответы моделей подавались на вход LLM-судьям в анонимизированном виде без указания источника генерации. Все ответы были приведены к унифицированному текстовому формату без метаданных, позволяющих идентифицировать модель. Судьям не передавалась информация о составе тестируемых моделей.

Несмотря на предпринятые меры, полностью исключить потенциальные систематические смещения (bias), связанные с архитектурными особенностями моделей-судей, невозможно, особенно с учётом того, что часть моделей выступает одновременно в роли тестируемых и судей. Данный эффект компенсируется использованием нескольких независимых судей, усреднением оценок и дополнительной независимой экспертной валидацией (см. раздел 1.6); его влияние подробно обсуждается в разделе 3.
1.2. Тестируемые модели
В тестировании участвовали 15 open-source LLM различных архитектур и размерностей (табл. 2), включая современное семейство Gemma 4 от Google DeepMind — плотную модель Gemma-4−31B и MoE-вариант (Mixture-of-Experts) Gemma-4−26B-A4B. Модели запускались локально на серверах в форматах FP8 (с последними оптимизациями NVFP4 для GLM-4.7-Flash и нативной MXFP4 для семейства GPT-OSS), а также в формате GGUF (квантизация Q4_K_M, Q4_K_S и Q6_K) через Ollama. Все модели использовались в режиме инструктивного вывода (instruct/chat). Модель QwQ-32B тестировалась в двух вариантах квантизации (Q6_K и Q4_K_M), что даёт 16 конфигураций. Архитектуры и характеристики моделей описаны в соответствующих технических отчётах и официальных публикациях разработчиков [7−14, 17−21]. Для версий, выпущенных в формате релизов и пока не сопровождаемых отдельными научными статьями (Qwen3.5, Gemma 4, GLM-4.7-Flash, DeepSeek-V4), в качестве источников приведены официальные карточки моделей и страницы релизов разработчиков; для предыдущих поколений тех же семейств сохранены ссылки на соответствующие технические отчёты, описывающие базовые архитектурные решения.
1.1. Дизайн бенчмарка
Бенчмарк охватывает 16 профессиональных доменов (табл. 1). Для каждого домена сформирован набор из 90 вопросов, распределённых равномерно по трём уровням сложности: уровень 1 (базовые профессиональные вопросы, 30 вопросов), уровень 2 (продвинутые вопросы, 30 вопросов), уровень 3 (экспертные вопросы, 30 вопросов). Общий объём бенчмарка — 1 440 вопросов. Вопросы и эталонные ответы формировались при участии специалистов-практиков соответствующих предметных областей, что обеспечивает релевантность заданий реальным профессиональным задачам. Медицинская предметная область разделена на два домена — «клинические процессы здравоохранения» (документооборот, диагностика, организация) и «терапевтическая практика» (приём терапевта, диагностика заболеваний, фармакотерапия), что отражает потребности целевого практического приложения — платформы аналитики медицинских карт.
2. Результаты исследования
Рисунок 3. Модели-лидеры по 16 профессиональным доменам (взвешенный балл)
Таблица 6. Лидеры по профессиональным доменам (взвешенный балл)
Таблица 5. Согласованность оценок судей (σ — среднее стандартное отклонение)
Рисунок 2. Устойчивость моделей к повышению сложности (средний балл по уровням)
Рисунок 1. Зависимость взвешенного среднего балла от размера модели
Таблица 4. Общий рейтинг моделей по уровням сложности
Таблица 8. Итоговый рейтинг моделей для профессиональных задач
2.6. Итоговый рейтинг и рекомендации
Сводный итоговый рейтинг моделей с разбивкой на тиры (S/A/B/C) представлен в табл. 8. Тиры формируются на основе совокупности взвешенного среднего балла, деградации D (m) и согласованности σ; рекомендации соответствуют наблюдаемым доменным сильным сторонам каждой модели.
Таблица 7. Влияние параметров генерации на средний балл
2.5. Влияние параметров генерации
Сравнение результатов при различных параметрах генерации (табл. 7), выполненное в рамках предварительной настройки методики на представительной подвыборке моделей, показывает: повышение temperature с 0 до 0,8 приводит к снижению среднего балла примерно на 0,2−0,3 балла (по шкале 0−10) для большинства моделей из рассмотренной подвыборки. Снижение repeat penalty с 1,2 до 1,05 при temperature = 0 оказывает минимальное влияние (±0,1 балла), что указывает на бо́льшую значимость температуры. На основании этих результатов в основной серии экспериментов применялась детерминированная генерация (temperature = 0, repeat penalty = 1,2).
2.4. Доменная специализация
Анализ результатов в разрезе доменов по формуле (5) выявляет выраженную специализацию (табл. 6, рис. 3). Лидерство распределено между четырьмя моделями: Qwen3.5−27B доминирует в 8 доменах из 16, GPT-OSS-120B — в 6, Gemma-4−31B и Gemma-4−26B-A4B — в одном каждая. Ни одна модель не является универсальным лидером, что обосновывает стратегию комбинированного использования моделей в мультиагентных системах.
2.3. Согласованность оценок судей
Дисперсия оценок, вычисленная по формуле (4), характеризует структурированность ответов модели и однозначность их интерпретации судьями (табл. 5; приведены репрезентативные конфигурации из общего набора). При шкале оценок 0−10 наиболее консистентные ответы формируют GPT-OSS-120B (σ = 0,35), Nemotron-70B (σ = 0,40), Gemma-4−31B (σ = 0,41) и Qwen3.5−27B (σ = 0,42). Повышенная дисперсия GLM-4.7-Flash (0,64) и GPT-OSS-20B (0,59) указывает на бо́льшую вариативность интерпретации ответов этих моделей разными судьями. Низкие значения σ для моделей-лидеров свидетельствуют о согласованной положительной оценке всеми тремя независимыми судьями.
2.2. Анализ устойчивости к повышению сложности
Деградация D (m), вычисленная по формуле (3) и визуализированная на рис. 2, является ключевым показателем надёжности модели. Высокая устойчивость (D ≤ 0,30): Gemma-4−31B (0,21), Qwen3.5−27B (0,22), Qwen3.5−9B (0,23), Gemma-4−26B-A4B (0,26). Сниженная устойчивость (D > 1,0): Calme-2.4-RYS-78B (1,17), Mistral-Nemo-12B (1,14). Значительное проседание на экспертных вопросах повышает риск генерации уверенных, но неточных ответов (hallucinated confidence) [16]. Современные семейства Qwen3.5 и Gemma 4 демонстрируют существенно лучшую устойчивость к нарастанию сложности по сравнению с моделями предыдущих поколений.
Как видно из рис. 1 и табл. 4, наблюдается слом классической зависимости «больше параметров — выше качество». Наивысший взвешенный балл в рейтинге показывает Qwen3.5−27B (27 млрд, FP8) — 9,33, что близко к результату GPT-OSS-120B (120 млрд, 9,28). Семейство Gemma 4 — Gemma-4−31B (31 млрд, 9,28) и MoE-вариант Gemma-4−26B-A4B (26 млрд, 9,27) — также входит в группу лидеров с минимальным разрывом. Таким образом, четыре модели топ-рейтинга охватывают диапазон 26−120 млрд параметров и демонстрируют практически идентичное качество. Различия взвешенных баллов внутри группы лидеров не превышают 0,06 балла и сопоставимы с погрешностью оценки; доверительные интервалы и проверка статистической значимости в настоящей работе не вычислялись, поэтому утверждать о превосходстве какой-либо одной из этих моделей над другими внутри группы некорректно — её следует рассматривать как статистически неразличимую. При этом ряд более крупных моделей (Calme-2.4-RYS-78B — 78 млрд, 8,17 балла) показывает результаты на 1+ балл хуже компактных лидеров.
2.1. Общий рейтинг моделей
В таблице 4 представлен общий рейтинг моделей. Результаты вычислены по формулам (1)-(5) на основе агрегации данных по всем 16 доменам. Применена шкала 0−10. В колонке «Взвеш. среднее» приведено итоговое значение по формуле (5) с весами уровней сложности 0,6 / 0,8 / 1,0, отражающими нарастание профессиональной значимости.
3. Обсуждение результатов
Конкурентоспособность компактных моделей. Центральным результатом исследования является эмпирическое подтверждение того, что современные модели размерности 27−31 млрд параметров достигают результатов, сопоставимых с моделями со 120 млрд параметрами, и в части доменов оказываются в числе лидеров. В группе лидеров общего рейтинга — Qwen3.5−27B (27 млрд, FP8) — показывает наивысший взвешенный балл 9,33, практически наравне с GPT-OSS-120B (120 млрд, 9,28). Модели семейства Gemma 4 — плотная Gemma-4−31B (FP8) и MoE-вариант Gemma-4−26B-A4B — показывают 9,28 и 9,27 балла соответственно, демонстрируя возможность достижения уровня крупных моделей при кратно меньшем числе активируемых параметров. Данное наблюдение согласуется с тенденцией, фиксируемой в мировом сообществе: архитектурные решения (Mixture-of-Experts, reasoning-оптимизация, качество обучающих данных, FP8-квантизация) позволяют компактным моделям конкурировать со сверхкрупными аналогами [7, 8].

Устойчивость как ключевой дифференциатор. На базовых вопросах большинство моделей показывает 8,5−9,5 балла (по шкале 0−10), однако на экспертных вопросах деградация D варьируется в широком диапазоне — от 0,21 (Gemma-4−31B) до 1,17 (Calme-2.4-RYS-78B). Модели семейств Qwen3.5 и Gemma 4 теряют 0,21−0,26 балла при переходе от базовых к экспертным задачам, что свидетельствует о высокой надёжности на сложных профессиональных запросах. Для отраслевых приложений выбор модели должен опираться на устойчивость при нарастании сложности, а не на пиковый балл при простых вопросах: разница в 1+ балл на экспертных вопросах между лидерами и аутсайдерами рейтинга прямо влияет на качество профессиональных ответов в реальных сценариях использования.

Систематические смещения судей и экспертная верификация. Двойная роль GLM-4.7-Flash и GPT-OSS-120B (тестируемые и судьи) создаёт потенциальный конфликт интересов, частично компенсируемый тройным судейством, усреднением оценок и включением в пул внешнего судьи DeepSeek-V4-Flash, не входящего в состав тестируемых моделей. Вместе с тем формальный количественный анализ распределения оценок по каждому судье (с выявлением возможного систематического завышения баллов «родственным» моделям) в настоящей работе не проводился и выделен как направление дальнейших исследований; перечисленные меры компенсации носят процедурный, а не статистически подтверждённый характер. Дополнительная качественная верификация результатов специалистами-практиками (см. раздел 1.6) в целом согласуется с оценками LLM-судей: расхождения между экспертными оценками и оценками LLM-судей находятся в пределах естественной вариативности и, по качественной оценке экспертов, не носят выраженного систематического характера. В дальнейших исследованиях целесообразно дополнительно расширить судейский пул моделями разных архитектур и провайдеров, а также формализовать количественные метрики согласованности экспертных и автоматизированных оценок (коэффициенты корреляции и меры согласия) [5, 6].

Практические рекомендации для отраслевых приложений. Для мультиагентных комплексов (в том числе для аналитики медицинских карт с интеграцией через API с МИС и RAG-базами данных) оптимальна комбинация мультиязычных моделей семейства Qwen3.5 (Qwen3.5−27B как универсальный профессиональный агент) и моделей семейства Gemma 4 (Gemma-4−31B для устойчивости на сложных задачах, Gemma-4−26B-A4B как ресурсоэффективная MoE-альтернатива). Для формализованных доменов (право, клинические процессы, продажи) лидером выступает GPT-OSS-120B, обеспечивающая наивысшую согласованность оценок (σ = 0,35) при максимальной размерности. Для систем с ограниченными ресурсами Qwen3.5−9B (9 млрд) демонстрирует лучшее соотношение качества к размеру (9,09 балла) и подходит для пограничных применений [7, 13].

Ограничения исследования. Бенчмарк ориентирован на русскоязычные задачи; экстраполяция на другие языки требует валидации. Тестирование проведено в формате одиночных вопросов без учёта многоходовых диалогов и интеграции с RAG-системами. Состав вопросов верифицирован привлечёнными специалистами-практиками; экспертная сверка оценок LLM-судей с независимыми оценками экспертов выполнена и описана в разделе 1.6. Однако формальная сертификация экспертов по каждому из 16 доменов не проводилась. Серии экспериментов с различными параметрами генерации (раздел 2.5) выполнены на представительной подвыборке моделей в режиме предварительной настройки методики; полная валидация на всех 15 моделях оставлена для последующих исследований.

Доступность данных и кода. В целях обеспечения воспроизводимости методики набор оценочных заданий с эталонными ответами, использованные системные подсказки, инструкции для моделей-судей и программный код оценочного пайплайна могут быть предоставлены по обоснованному запросу к авторам. Описанные в работе элементы (дизайн бенчмарка, формулы агрегации оценок (1)-(5), параметры генерации и состав моделей-судей) приведены в объёме, достаточном для независимого воспроизведения методики на произвольном наборе доменов и моделей.
Заключение
Представлена воспроизводимая методика мультидоменного сравнительного тестирования open-source больших языковых моделей на русскоязычных задачах профессиональных предметных областей. Бенчмарк охватывает 16 доменов, 1 440 вопросов и двухэтапную оценку (мультисудейскую LLM-as-a-Judge и независимую экспертную валидацию).

Установлено, что современные модели размерности 27−31 млрд параметров (Qwen3.5−27B, Gemma-4−31B, Gemma-4−26B-A4B) достигают результатов, сопоставимых с моделями со 120 млрд параметрами (GPT-OSS-120B), при кратно меньшем потреблении вычислительных ресурсов. Деградация по уровням сложности варьируется от 0,21 балла (Gemma-4−31B) до 1,17 (Calme-2.4-RYS-78B). Обнаружена выраженная доменная специализация: ни одна модель не является лидером во всех 16 доменах, что обосновывает стратегию комбинированного использования моделей в мультиагентных системах. Детерминированная генерация (temperature = 0) обеспечивает прирост порядка 0,2−0,3 балла относительно стохастической по результатам прогонов на представительной подвыборке моделей. Качественная экспертная верификация согласуется с автоматизированными оценками LLM-судей.

Результаты представляют практическую ценность для организаций, внедряющих ИИ-системы на базе open-source LLM: мультиагентные аналитические комплексы, RAG-платформы, модули автоматизации документооборота и аналитики медицинских карт с интеграцией с МИС. Методика может быть адаптирована для расширенного набора доменов, языков и моделей.
Список литературы
Список литературы
1. Hendrycks D., Burns C., Basart S. [et al.]. Measuring Massive Multitask Language Understanding [Электронный ресурс] // arXiv. 2021. arXiv: 2009.3 300. DOI: 10.48 550/arXiv.2009.3 300. URL: arxiv.org/abs/2009.3 300 (дата обращения: 16.04.2026).

2. Fenogenova A., Chervyakov A., Martynov N. [et al.]. MERA: A Comprehensive LLM Evaluation in Russian // Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Bangkok: Association for Computational Linguistics, 2024. P. 9920−9948. DOI: 10.18 653/v1/2024.acl-long.534.

3. Shavrina T., Fenogenova A., Emelyanov A. [et al.]. RussianSuperGLUE: A Russian Language Understanding Evaluation Benchmark // Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP). Stroudsburg: Association for Computational Linguistics, 2020. P. 4717−4726. DOI: 10.18 653/v1/2020.emnlp-main.381.

4. Chiang W.-L., Zheng L., Sheng Y. [et al.]. Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference // Proceedings of the 41st International Conference on Machine Learning (ICML). Vienna: PMLR, 2024. P. 8359−8388.

5. Zheng L., Chiang W.-L., Sheng Y. [et al.]. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena // Advances in Neural Information Processing Systems (NeurIPS). 2023. Vol. 36. P. 46 595−46 623. DOI: 10.48 550/arXiv.2306.5 685.

6. Zhu L., Wang X., Wang X. JudgeLM: Fine-tuned Large Language Models are Scalable Judges // Proceedings of the 13th International Conference on Learning Representations (ICLR). 2025. DOI: 10.48 550/arXiv.2310.17 631.

7. Qwen Team. Qwen3 Technical Report [Электронный ресурс] // arXiv. 2025. arXiv: 2505.9 388. DOI: 10.48 550/arXiv.2505.9 388. URL: arxiv.org/abs/2505.9 388 (дата обращения: 22.04.2026).

8. Yang A., Yang B., Hui B. [et al.]. Qwen2 Technical Report [Электронный ресурс] // arXiv. 2024. arXiv: 2407.10 671. DOI: 10.48 550/arXiv.2407.10 671. URL: arxiv.org/abs/2407.10 671 (дата обращения: 25.04.2026).

9. Google DeepMind. Gemma 3 Technical Report [Электронный ресурс] // arXiv. 2025. arXiv: 2503.19 786. DOI: 10.48 550/arXiv.2503.19 786. URL: arxiv.org/abs/2503.19 786 (дата обращения: 28.04.2026).

10. Abdin M., Aneja J., Behl H. [et al.]. Phi-4 Technical Report [Электронный ресурс] // arXiv. 2024. arXiv: 2412.8 905. DOI: 10.48 550/arXiv.2412.8 905. URL: arxiv.org/abs/2412.8 905 (дата обращения: 30.04.2026).

11. Jiang A. Q., Sablayrolles A., Roux A. [et al.]. Mixtral of Experts [Электронный ресурс] // arXiv. 2024. arXiv: 2401.4 088. DOI: 10.48 550/arXiv.2401.4 088. URL: arxiv.org/abs/2401.4 088 (дата обращения: 04.05.2026).

12. Adler B., Agarwal N., Aithal A. [et al.]. Nemotron-4 340B Technical Report [Электронный ресурс] // arXiv. 2024. arXiv: 2406.11 704. DOI: 10.48 550/arXiv.2406.11 704. URL: arxiv.org/abs/2406.11 704 (дата обращения: 06.05.2026).

13. GLM Team. ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools [Электронный ресурс] // arXiv. 2024. arXiv: 2406.12 793. DOI: 10.48 550/arXiv.2406.12 793. URL: arxiv.org/abs/2406.12 793 (дата обращения: 08.05.2026).

14. Groeneveld D., Beltagy I., Walsh P. [et al.]. OLMo: Accelerating the Science of Language Models // Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers). Bangkok: Association for Computational Linguistics, 2024. P. 15 789−15 809. DOI: 10.18 653/v1/2024.acl-long.841.

15. Gao L., Tow J., Abbasi B. [et al.]. A Framework for Few-Shot Language Model Evaluation [Электронный ресурс]. Zenodo, 2023. DOI: 10.5281/zenodo.10 256 836. URL: doi.org/10.5281/zenodo.10 256 836 (дата обращения: 12.05.2026).

16. Kadavath S., Conerly T., Askell A. [et al.]. Language Models (Mostly) Know What They Know [Электронный ресурс] // arXiv. 2022. arXiv: 2207.5 221. DOI: 10.48 550/arXiv.2207.5 221. URL: arxiv.org/abs/2207.5 221 (дата обращения: 14.05.2026).

17. Qwen Team. Qwen3.5: Towards Native Multimodal Agents [Электронный ресурс]. 2026. URL: qwen.ai/blog?id=qwen3.5 (дата обращения: 02.06.2026).

18. Google DeepMind. Gemma 4: The most capable open models [Электронный ресурс]. 2026. URL: blog.google/innovation-and-ai/technology/developers-tools/gemma-4/ (дата обращения: 03.06.2026).

19. Zhipu AI (Z.ai). GLM-4.7-Flash: An efficient MoE model for local coding and agents [Электронный ресурс]. 2026. URL: www.zhipuai.cn/en/news/148 (дата обращения: 04.06.2026).

20. OpenAI. gpt-oss-120b & gpt-oss-20b Model Card [Электронный ресурс] // arXiv. 2025. arXiv: 2508.10 925. DOI: 10.48 550/arXiv.2508.10 925. URL: arxiv.org/abs/2508.10 925 (дата обращения: 05.06.2026).

21. DeepSeek-AI. DeepSeek-V4 Technical Report [Электронный ресурс]. 2026. URL: huggingface.co/deepseek-ai/DeepSeek-V4-Pro (дата обращения: 06.06.2026).