Legal AI Benchmarking: как это делают там. Часть 1: независимые фасилитаторы

Первая часть большого обзора о том, как на западном рынке оценивают AI-продукты на юридических задачах.

В декабре я выкладывала результаты делай_bench и собранную после него обратную связь сообщества. С тех пор меня волнует методология проведения бенчмарков Legal AI-продуктов: у отрасли много узких мест и в силу самой доменной специфики, и в контексте сложившегося ландшафта рынка AI-LegalTech продуктов.

Изыскания по одному из предыдущих проектов — попытке сделать замер оптимального устройства RAG-систем судебной практики — привели меня к открытиям о том, как бенчмаркинг ИИ-продуктов делают на западе. У коллег богатый на инсайты опыт, и мне захотелось сделать об этом серию публикаций.

  1. Часть 1: Независимые фасилитаторы — Vals AI и Legalbenchmarks.ai, вы читаете этот пост.
  2. Часть 2: Академия и вендоры — обзор работы группы учёных крупного американского университета, признанного российскими государственными органами нежелательной организацией, а также то, как свои замеры делают Harvey, Thomson Reuters, LexisNexis.
  3. Часть 3: Методологические выводы — метаобзор методов, оценка их переносимости на нашу почву, на которой AI-LT продукты растут аки грибы, мысли о судьбах российского Legal AI-бенчмаркинга.

Начинаю с независимых, потому что те, кто меня знают, знают, насколько меня волнует тема независимых коммьюнити-управляемых бенчмарков.


Vals AI

Vals AI, Inc. — американская компания: настолько солидно, что даже есть раздел «Карьера» на сайте. Делает приватные отраслевые бенчмарки (право, налоги, финансы) и продаёт инфраструктуру оценки лабораториям и инженерным командам. Себя описывает как независимую платформу, хотя оговаривает, что имеет клиентские отношения с одним или несколькими участниками исследования.

В Vals считают, что популярные бенчмарки построены на надуманных академических датасетах; живые лидерборды скомпрометированы, потому что открытые датасеты попадают в предобучающие корпуса, а недобросовестные игроки дообучают модели прямо на оценочных наборах; результаты, которые публикуют разработчики моделей, предвзяты по построению.

На эти проблемы они отвечают любопытным устройством тестовых наборов данных. Каждый бенчмарк Vals разбит на три части:

  • Public Validation Set — полностью открытый набор образцов, чтобы методику можно было оценить со стороны
  • Private Validation Set — больший приватный набор, лицензируемый компаниям для внутренней валидации: вендоры могут проверить себя, не получив тест. Vals прикладывает статистическое доказательство того, что он коррелирует с тестовым
  • Test Set — приватен всегда, чтобы защищаться от утечки в датасеты для фундаментальных моделей. Только на нём собственно и делаются замеры.

Теперь посмотрим на три юридических исследования Vals, там буквально драма в трёх актах.

VLAIR, февраль 2025: замеры юридических продуктов

Первый Vals Legal AI Report оценивал продукты: CoCounsel (Thomson Reuters), Vincent AI (vLex), Harvey Assistant, Oliver (Vecflow). Дизайн разрабатывался совместно с Legaltech Hub.

Методика

На чём проверяли

На семи типах задач или, как мы их часто называем, сценариях юридической работы:

  • извлечение данных
  • Q&A по документу
  • суммаризация
  • редлайнинг (внесение исправлений в документы)
  • анализ транскриптов
  • построение хронологий
  • поиск по EDGAR (официальная электронная система Комиссии по ценным бумагам и биржам США (SEC), предназначенная для автоматического сбора, проверки, индексации и публикации финансовой отчётности компаний).

Список собирали опросом самих юрфирм: Vals пишет, что консенсуса о том, где генеративный ИИ полезнее всего, в отрасли не существует. Оси «отрасль права», как вы можете заметить, в дизайне нет.

Задачи писал консорциум фирм (Reed Smith, Fisher Phillips, McDermott Will & Emery, Ogletree Deakins + четыре анонимные): больше 500 комплектов «вопрос — эталонный ответ — критерии корректности», с пометкой, юрист какого уровня обычно это делает.

Человеческий baseline

Модели сравнивали с ответами живых юристов. Юристов нашла и координировала ассоциация Cognia Law:
Юристы получали задания в том же формате, как если бы они пришли от обычного клиента, — они не знали, что участвуют в бенчмарк-исследовании.

Как считали

Оценивала ответы сервисов проприетарная автоматизированная инфраструктура Vals, LLM-as-a-judge. Ручная оценка всех выходов заняла бы у одного человека больше 400 часов, при этом Vals признаёт, что LLM-судья «не замена экспертному человеческому оценщику», и что проваленные ответы дополнительно перепроверяли вручную.

LLM-судье давали эталонный ответ и инструкцию, как этот элемент проверять; судья возвращает pass/fail с объяснением.
Каждый эталон содержит несколько чекпоинтов, описывающих корректность ответа. Балл за задачу складывался из количества набранных чекпоинтов. То есть 8 чекпоинтов из 10 — это 80%.

Результаты

Юристы CoCounsel Vincent AI Harvey Oliver
Извлечение данных 71,1 73,2 69,2 75,1 64,0
Вопросы и ответы по документу 70,1 89,6 72,7 94,8 74,0
Суммаризация 50,3 77,2 58,9 72,1 62,4
Редлайн 79,7 53,6 65,0
Анализ транскрипций 53,7 64,8 77,8
Построение хронологий 80,2 78,0 80,2 66,9
Ресёрч по базе EDGAR 70,1 55,2

Живые юристы оказались лучше ИИ в правках документов и ресёрче по EDGAR, и сравнялись с Harvey по построению хронологий. Harvey с большим отрывом победил всех на ответах по документам. ИИ-продукты по скорости ожидаемо оказались быстрее юристов в 6–80 раз.

Оценивая Vincent AI, Vals столкнулись с той же проблемой, что и я в #делай_bench с сервисом АйЮрист:

💡
Когда в базе не хватало данных для ответа, Vincent AI отказывался отвечать, а не галлюцинировал. Хотя это негативно повлияло на баллы vLex, для ИИ-инструмента лучше осознавать свои ограничения.

Дело оказалось в критериях: набор чекпоинтов описывал только правильный ответ и не предусматривал легитимной альтернативной формы поведения. Другой бенчмарк-фасилитатор эту проблему решил, о чём расскажу ниже поподробнее.

Opt-in

Прочерки в таблице — не пропуски данных, а дизайн: каждый вендор сам выбирал, в какие задачи заходить, и имел право отозвать продукт — с отдельной задачи или из исследования целиком — до публикации.

Матрицу участия Vals публикует, и она информативнее результатов:

Источник

Отдельного упоминания заслуживает LexisNexis. Компания участвовала, но, как пишет Vals, после того как отчёт был написан, воспользовалась правом отозваться из задач по извлечению, суммаризации и Q&A; в отчёте её нет. Artificial Lawyer приводит объяснение самой компании: не совпали сроки, вышло крупное обновление Lexis+ AI, и тестировалась уже неактуальная версия.

Второе исследование — целиком про правовое исследование. Участники: Alexi, Counsel Stack, Midpage и ChatGPT (включить модель общего назначения было самой частой просьбой после первого отчёта).
Thomson Reuters, LexisNexis и vLex — три крупнейшие платформы правового исследования — в бенчмарке не участвовали. Представители TR и LexisNexis не объясняли причин, почему не заходили в исследование. vLex сначала согласился, но отозвался до публикации: его представитель пояснил, что бенчмарк не был спроектирован под enterprise-инструменты.

Ось проверки: типы исследовательских вопросов

Для этого замера составили 200 комплектов «вопрос — эталонный ответ — источники — критерии корректности», распределённых по десяти типам исследовательских вопросов, в частности:

  • подтверждение законодательного определения;
  • суммирование позиции по названному судебному решению;
  • поиск нормы или прецедента по фабуле;
  • обзор права 50 штатов — самая тяжёлая категория, её провалили все участники;
  • мультиюрисдикционные вопросы (14 штук) — сопоставить право нескольких юрисдикций;
  • поиск только что изменившегося регулирования;
  • точечный поиск данных в конкретном названном источнике;
  • понимание отраслевых терминов — на этом типе юристы взяли 100%, а ИИ — от 3% до 80%.

Типы определяли вместе с юрфирмами консорциума и практикующими юристами по принципу «что реально встречается в частной практике». То есть сервисы снова сравниваются не по отраслям права, а по типам задач.

Вопросы подавались моделям через API как zero-shot промпт, каждый не менее трёх раз для снижения вариативности вывода.

Метрика: три взвешенных критерия

  • Accuracy: верен ли ответ по существу, нет ли ошибок и пропусков относительно эталона. Вес метрики 50%, оценивается по шкале в 3 балла;
  • Authoritativeness: Сослался ли на релевантные и действующие первоисточники, включая те, что есть в эталоне. Вес метрики 40%, оценивается по шкале в 3 балла;
  • Appropriateness: Понятен ли ответ, можно ли сразу отправить коллеге или клиенту. Вес метрики 10%, оценивается по шкале в 2 балла.

Разведение accuracy и authoritativeness принципиально: правильный ответ без источника в праве не годится, и это отдельно измеримое свойство.

Кто оценивал

Здесь важное отличие от первого VLAIR: автоматической оценки не было вообще. Из-за потенциальной вариативности корректности любого ответа на исследовательский вопрос оценка проводилась вслепую группой юристов и правоведов-теоретиков.

Ответы анонимизировали (убирали ссылки на проприетарные источники, по которым опознаётся продукт; публичные ссылки оставляли, чтобы оценщик мог проверить). Каждый ответ оценивали минимум два оценщика, баллы усредняли, нулевые баллы перепроверял третий оценщик. Оценщикам выдавали эталон и критерии от юрфирм, но разрешали от эталона отступать, если он оказывался неполным, — чтобы не штрафовать ответы полнее эталона.

Что примечательно, среди оценщиков — Анна Гуо и Мохамед Аль Мамари из Legalbenchmarks.ai, о которых также будет в этом посте. Даже у них там на большом западе поле маленькое (и можно в него, думаю, без страха заезжать).

Результаты

Средневзвешенный балл: все четыре ИИ уложились в четыре пункта друг от друга (74–78%), человеческий baseline — 69%. По точности: юридические ИИ 78–81%, ChatGPT 80%, юристы — 71%.

  • Авторитетность — единственная ось, где юридические ИИ отрываются от ChatGPT: 76% против 70% у ChatGPT. Vals связывает это с доступом к проприетарным базам. Единственная категория, где ChatGPT обошёл юридические ИИ по авторитетности, — вопросы, требующие самой свежей информации: у него по умолчанию веб-поиск, а юридические продукты намеренно ограничивают источники своими базами.
  • Мультиюрисдикционные вопросы просаживают всех в среднем на 14 пунктов. Исключение — ChatGPT, у которого разброса не было.
  • ИИ превзошёл baseline на 150 вопросах из 200, и там, где превзошёл, — в среднем на 31 пункт.
  • Юристы выиграли 4 типа вопросов из 10, в среднем на 9 пунктов. Vals описывает эти типы как требующие «более глубокого понимания контекста, сложных мультиюрисдикционных обзоров и синтеза на основе суждения».

Третье исследование устроено принципиально иначе: Vals больше не меряет продукты. Он меряет 18 фронтирных моделей, обвязанных одинаковым агентным харнессом с юридическими инструментами.

💡
Харнесс (harness) — обвязка вокруг модели: набор инструментов, к которым у неё есть доступ, системный промпт, правила остановки. Одна и та же модель с разным харнессом — это разные системы. Здесь харнесс одинаковый для всех, поэтому единственная переменная — сама модель.

Логика перехода видна из предыдущих раундов: если вендоры не приходят, спрашивать разрешения больше не у кого. Модели, из которых сделаны продукты, доступны по API и согласия на измерение не требуют.

Методика

На чём проверяли

413 вопросов, написанных и отрецензированных практикующими юристами; у каждого — эталонный ответ, авторитетные источники и рубрики.
Датасет разбит по трёхчастной схеме: 5 публичных образцов / 200 в приватной валидации / 208 — тест, приватный навсегда; публикуются результаты только по тесту. Вопросы по этим частям распределены так, чтобы сохранить распределение типов вопросов, областей практики и сложности. Публичные образцы и сам харнесс выложены на GitHub — методику воспроизвести можно, данные — нет.

В харнессе у агента пять инструментов: поиск по практике (courtlistener_search по базе CourtListener), веб-поиск, извлечение информации из загруженных документов, парсинг HTML-страницы, отправка финального ответа. Лимит — три часа на задачу.

Рубрика и all-pass

💡
Рубрика (rubric) — это не оценочная шкала в привычном смысле. Это список элементов, которые ответ обязан содержать, составленный экспертом-юристом под конкретный вопрос. Каждый пункт — требование, а не пожелание, и проверяется бинарно: есть или нет. Здесь в рубрике от 1 до 31 пункта, в среднем 9,35.

Основная метрика — all-pass: вопрос засчитан, только если ответ удовлетворяет каждому пункту рубрики. Все прошли — 100%, хоть один не прошёл — 0%. Дополнительно считается weighted — доля набранных рубричных баллов, то есть тот самый частичный зачёт по чекпоинтам, который использовался в первом VLAIR.

Разница между двумя метриками на одних и тех же ответах: при частичном зачёте топ-модели берут больше 80% weighted. При строгом all-pass ни одна не преодолевает 49%.

Обоснование Vals:

Мы отчитываемся по all-pass как по основной метрике, потому что в юридической работе частично верный ответ может быть опаснее неверного: он читается как надёжный, но упускает критический пункт. Weighted-балл выше 80% может замаскировать, что ответ пропускает обязательный элемент.

Общий уровень all-pass по бенчмарку — 28,4%.

LLM-судья и его валидация

Судит GPT-5.4. Обоснование выбора:

Мы выбрали этого судью, потому что его оценки согласуются с мнением большинства из трёх человек-экспертов лучше, чем с этим большинством согласуется любой отдельно взятый человек-рецензент: GPT-5.4 совпадает с большинством в 87,4% случаев против 83,4% в среднем у человека.

Это корректный способ обосновывать LLM-судью: не «LLM надёжнее человека вообще», а «на этой рубрике и этих задачах его согласие с экспертным консенсусом не хуже, чем у самих экспертов». Величина измеримая, и она опубликована.

Результаты, снимок на 9 июля 2026

Источник

Отрасль права как ось отчётности

Задачи покрывают восемь областей: административное и регуляторное право, уголовное, коммерческое, конституционное, здравоохранение, гражданский процесс, семейное, иммиграционное. Но это ось отчётности, а не ось дизайна: по отраслям ничего не строилось, они служат разрезом результатов. Категории не взаимоисключающие — многие вопросы затрагивают сразу несколько областей.

По моделям:

Модель Family Criminal Civil Lit Admin/Reg Health
GPT-5.6 Sol 14 44 41 61 80
Claude Opus 4.8 18 46 52 44 53
Claude Sonnet 5 18 40 44 55 63
GPT-5.6 Terra 14 37 33 58 77
Claude Sonnet 4.6 27 37 30 44 53

Обе модели поколения GPT-5.6 сильны в регуляторно нагруженных областях (80% и 77% в здравоохранении) и слабы в семейном праве — 14%, хуже, чем у Claude Sonnet 4.6 с его 27%.

Vals формулирует это так: сложность области практики и способности модели накладываются друг на друга, и ни один из факторов не перекрывает другой. Семейное право даётся тяжело всем (в среднем ~12% all-pass), а здравоохранение всем даётся легче (~44%). Из этого видно, что отрасль не выравнивает модели. Внутри одного здравоохранения разброс идёт от 17% у слабых моделей до 80% у лидера — то есть шире, чем разброс между средними по отраслям. И при этом общий рейтинг не переносится на отрасль. GPT-5.6 Sol занимает первое место в бенчмарке с 48,08%, но в семейном праве берёт 14% — и проигрывает там Claude Sonnet 4.6, который в общем зачёте шестой, а в семейном лучший с 27%.

То есть в разных отраслях лидеры разные, и порядок в таблице перетасовывается. Отсюда вывод: агрегированный балл не переносится на конкретную практику. «Первое место, 48,08%» не говорит семейному юристу ни какой уровень надёжности его ждёт, ни даже какую модель ему брать.

Двойная разметка вопросов

Каждый вопрос несёт две метки: базовый тип рассуждения, которого он требует, и overlay-флаг — дополнительный источник сложности, который может лечь на любой базовый тип. Вопрос может иметь несколько базовых типов и любое сочетание флагов, включая ни одного.

  • Regulatory Framework Interpretation: как подзаконные акты и разъяснения государственных органов реализуют закон и работают вместе. Средний All-pass вопросов с этой меткой: 37,8%
  • Statutory Interpretation: значение и смысл текста закона, как его толковали суды. Средний All-pass вопросов с этой меткой: 26,4%
  • Doctrinal Rule Reasoning: определить применимый доктринальный тест и правильно применить его к фабуле. Средний All-pass вопросов с этой меткой: 25,5%
  • Temporal Validity: ответ зависит от того, действует ли норма и как она менялась. Средний All-pass вопросов с этой меткой: 27,3%
  • Reconciliation: требуется синтез через несколько источников: сравнить юрисдикции, сопоставить противоречащие правовые позиции судов, разрешить коллизии норм. Средний All-pass вопросов с этой меткой: 20,7%

Как видно, Reconciliation — самый сложный флаг во всём бенчмарке: 20,7% против 28,4% all-pass в среднем во всём замере. Разрыв держится у каждой модели без исключения: каждая берёт на сложных вопросах, требующих усреднения позиций разных источников, меньше, чем на любых остальных — нет ни одной модели, которая была бы сильна в сведении конфликтующих источников.

Temporal Validity, для контраста, самостоятельным препятствием не оказался: 27,3% — фактически на уровне общего среднего. Понять, действует ли норма до сих пор, модели умеют. Свести вместе источники, которые друг другу противоречат, — нет.

Другое интересное из замера (разверните для деталей)

Vals отчитывается не одной точностью. По каждой модели публикуются стоимость прогона задачи, латентность, число ходов и вызовов инструментов, распределение вызовов по типам инструментов, траектория (в каком порядке модель искала, читала и извлекала), длина ответа и число процитированных источников. Точность откладывается против стоимости и латентности на Парето-графике: видно не только, кто точнее, но и кто точнее за разумные деньги и время.

Эффективность не равна усилиям. Claude Opus 4.8 тратит в среднем 12 ходов и 28 вызовов инструментов на задачу (~$2,82, ~12 минут). Kimi K2.6 — свыше 90 ходов и 100+ вызовов, и берёт 15,87%. На разобранном публичном примере Kimi сделал 174 вызова, в основном веб-поиск, Opus 4.8 — 38. Самая выгодная по деньгам из приличных: GLM 5.2 — 31,25% меньше чем за доллар за задачу.

Перекос в сторону веб-поиска — практики слабых моделей. В среднем по моделям web_search вызывается чаще, чем поиск по судебной практике: 26 вызовов за сессию против 11 у courtlistener_search. Но это именно среднее, а не характеристика каждой модели: Claude Opus 4.8 балансирует практику и веб примерно поровну. Средний перекос создают слабые модели, которые гонят вал запросов — преимущественно веб-поисковых — не конвертируя это в точность.

Длина ответа. Эталонные ответы — в среднем 536 слов; все модели пишут длиннее, Claude Sonnet 4.6 — около 2 300. Самые длинные ответы при этом не самые высокооценённые: рубрика вознаграждает верное и подкреплённое рассуждение, а не объём. То же с источниками: большинство моделей цитируют больше эталонных 6,2, но балл определяется качеством и релевантностью, а не количеством.


Legalbenchmarks.ai

Legalbenchmarks.ai — не компания-оценщик, а сообщество. Первый раз я о нём услышала в канале Хольгера Цшайге и испытала сильную эмоцию: кто-то уже делает то, что хотела бы делать я, что так нужно российскому AI-LT рынку!

Основательница — Анна Гуо; по описанию проекта, она замеряла работу ИИ в реальных юридических воркфлоу вместе с более чем 500 юристами, и эта работа повлияла на сотни закупочных решений. У проекта есть CTO, специалист по AI Trust & Safety, целый консультативный совет из in-house-юристов (Zoom, Morgan Stanley, Henkel, Santander, Franklin Templeton, Razer, Dentsu) и большой комитет из юристов-практиков.

Методология

Основной проект — это лидерборд (последнее обновление — июль 2026, перезапуск ежемесячный). Он строится на 63 задачах, составленных вокруг реальных запросов, с которыми юристы в действительности приходят к ИИ:

  • 34 задачи на драфтинг договоров: написать пункт с нуля, отредлайнить чужой драфт, подготовить допсоглашение, собрать соглашение из шаблона, переформулирование текстов.
  • 29 задач на извлечение информации: найти в документе оговорку, определение, применимое право, суммы, обязательства. Задачи варьируются по широте вопроса, чистоте документа, числу документов и — существенное — по тому, присутствует ли ответ вообще: есть, отсутствует, частичный или противоречивый.

Ось дизайна — снова сценарий работы, а не отрасль права. Отрасли подсвечены («коммерческое, IP, трудовое, M&A, антимонопольное»), но как оговорка о «смещении», имеющем место в наборе данных, а не как принцип построения. Все задачи одноходовые: одна инструкция, один ответ.

Откуда берутся задачи:

  1. Авторские задачи от юристов-практиков — ядро набора. Юристы сообщества пишут задачи, инструкции по оценке, референсные ответы на основе реальных сценариев из своей работы.
  2. Синтетические задачи — но сгенерированные по довольно нетривиальной методике: их не придумывают с нуля, а выращивают из режимов отказа (failure mode), то есть класса ситуаций, где ответ предсказуемо оказывается неверным. Например: модель выдумывает источник; пропускает один из обязательных элементов ответа; превращает условный ответ («да, если соблюдены А и Б») в безусловный («да»).

У Legalbenchmarks было два предыдущих раунда — Phase 1 (извлечение информации: 6 ассистентов на 18 задачах) и Phase 2 (драфтинг: 13 инструментов и человеческий baseline на 30 задачах). В обоих они не только считали баллы, но и разбирали, как именно модели ошибались, и выписывали повторяющиеся способы. Получившийся список режимов отказа стал заданием для генератора задач: построить новые задания, которые целятся ровно в эти уязвимости. Туда же пошли режимы отказа, вычитанные из чужих опубликованных бенчмарков. Каждую сгенерированную задачу перед попаданием в набор проверяет человек-эксперт: машина предлагает, юрист утверждает.

Замер качества

Качество считается по двум независимым осям, которые принципиально не складывают в единый балл:

Reliability — «правильный ли ответ»: точность, полнота, релевантность заданному и честность в отношении того, чего ИИ не знает, вместо выдумывания. Отчитывается как доля задач, выполненных полностью верно, — то есть тот же all-pass.

Usefulness — «можно ли этим пользоваться как есть»: три подбалла (ясность, длина, структура), каждый по шкале 1–3, где 1 — переделывать перед использованием, 2 — пригодно с правками, 3 — использовать как есть. Подсчитывает среднее из трёх.

Как говорят авторы, меморандум может быть технически точным и нечитаемым — или прекрасно оформленным и неверным; раздельная отчётность сохраняет это различие.

Чеклист, который допускает несколько правильных ответов

Это прямой ответ на возражение, которое мне писали в комментариях к #делай_bench, ну и которое очевидно из специфики юридического домена: в праве часто нет единственного правильного ответа, и непонятно, что тогда проверять.

Решение Legalbenchmarks — чеклист требований, который пишет тот же юрист, что составил задачу. Множественность правильных ответов кодируется прямо в чеклисте. Например, юрист поручает ИИ составить заведомо неисполнимый пункт. Критерии написаны так, чтобы засчитать любую из нескольких легитимных форм ответа:

  • отказаться составлять и объяснить почему;
  • составить запрошенный пункт, но явно пометить риск;
  • предложить законную альтернативу с обоснованием замены.

Молчаливое исполнение плохой инструкции засчитывается как fail.

Сравните с первым VLAIR, где отказ Vincent AI отвечать снижал баллы. Здесь принципиальное отличие подхода в том, что чеклист описывает не только правильный ответ, но и запрещённые ходы.

Судьи и их валидация

Reliability оценивает один LLM-судья (Claude Sonnet 4.6) против чеклиста задачи. Usefulness — панель из двух судей (Claude Sonnet 4.6 и Gemini 3.1 Pro), работающих параллельно по каждой ячейке; оценки усредняются в консенсус.

Дальше — две проверки самого судьи.

1. Cross-grader agreement — согласие между судьями. На ~1 700 парных оценках два судьи usefulness дали точно одинаковый балл примерно в 82% случаев. По подкритериям согласие расходится: ясность — около 97%, структура — 83–94%, а длина — всего 56–64%. Ячейки, где судьи разошлись на два и более пункта, уходят на ручной пересмотр.

2. Favoritism check — проверка на кумовство. Проверяют, не завышает ли судья баллы моделям своего же производителя. Судья — Claude Sonnet 4.6; в данных это не проявляется: Sonnet не возглавляет лидерборд usefulness ни в одной категории, а по подкритерию длины модели Anthropic вообще внизу таблицы — противоположность тому, что дал бы предвзятый судья.

Обе проверки методологически несложны и стоят почти ничего. Но без такой обвязки LLM-судья — это просто мнение одной модели о других, и устойчивость этого мнения не известна никому, включая авторов бенчмарка.

Результаты: драфтинг договоров, июль 2026

Источник

Вывод авторов раунда: ИИ всё ещё недостаточно надёжен, чтобы драфтить договоры без перепроверки. Лидер проваливает примерно каждую третью задачу.

Три наблюдения, ради которых оси и разводили:

  • GPT-5.6 Sol драфтит красивее, чем точнее. Наивысшая полезность среди топов (2,75) при 44,1% надёжности. Текст читается чистым и финальным, но более половины его драфтов пропускают минимум одну инструкцию — и эти ошибки легко не заметить именно потому, что драфт выглядит опрятно. Единый балл такое расхождение не позволил бы заметить.
  • Grok 4.5 — единственная модель, которая последовательно распознавала, что существующая формулировка уже нормальная, и не трогала её. Не редактировать то, что не надо редактировать, — отдельная способность.
  • Конфликты остаются общей слабостью поля. Там, где инструкции противоречат исходным документам или друг другу, большинство моделей драфтят сквозь противоречие, а не поднимают его. Лучше всех эти случаи отработал Opus 4.8; GPT-5.6 Sol чаще прочих продолжал драфтить, не отметив проблему.

Ограничения бенчмарка

  • 63 задачи, смещение в коммерческое, IP, трудовое, M&A, антимонопольное; только английский язык, уклон в США и Великобританию.
  • Только одноходовые задачи. Многоходовые воркфлоу, длинные дела, итеративная доработка не тестируются — «а это ближе к тому, как юристы реально используют эти инструменты».
  • LLM-судьи валидируются людьми выборочно, а не по каждой задаче.
  • Системные промпты стандартизованы: модель, которая выиграла бы от более тонкого промпта, здесь выглядит слабее, чем на практике.
  • Консистентность и дрейф не тестируются: один прогон на задачу. Насколько выход модели гуляет при повторных прогонах одного и того же задания, не измеряется.

Сам набор задач, референсные документы и покритериальные чеклисты не публикуются: полная публикация позволила бы вендорам подстраиваться под бенчмарк. Исследователи могут запросить доступ к методологии, вендоры — прислать свой инструмент на прогон по тем же задачам.


Источники

Даты снимков: Vals Legal Research Bench — 9 июля 2026; Legalbenchmarks — июль 2026. Оба обновляются: Vals — по мере выхода моделей, Legalbenchmarks — ежемесячно.