← Все статьи Кейсы и метрики

Сравнение ИИ для юристов: Opus, ГранаЙ, Gemini, ChatGPT

Олег Никитин · · 1 мин чтения

7 июля 2026 года мы провели слепой тест: один и тот же вопрос из корпоративного и налогового права одновременно задали ГранаЙ, нашей системе с доменной настройкой на юридическую практику, и трём массовым ИИ-чатам — ChatGPT, Gemini и Claude, — без раскрытия того, кто из них отвечает. По итогам этого одного вопроса и пяти критериев оценки первое место у Claude Opus 4.8 — 38 баллов из 50 возможных, ГранаЙ на втором месте с 37 баллами, Gemini 2.5 Flash Ext. — 36, ChatGPT Instant — 33. Дальше — полная матрица по критериям, честный разбор того, где мы уступаем, и что из этого следует для юриста, который выбирает инструмент.

Содержание:

  1. Методика: один вопрос, слепая оценка, проверка по первоисточникам
  2. Результаты: 38 против 37, 36 и 33
  3. Почему победил Claude Opus 4.8
  4. Почему ChatGPT занял последнее место, почти не ошибившись
  5. Что тест показал про ГранаЙ
  6. Что это значит для юриста, который выбирает инструмент

Методика: один вопрос, слепая оценка, проверка по первоисточникам

Мы задали одинаковый вопрос из корпоративного и налогового права ГранаЙ и трём массовым ИИ-чатам, не раскрывая эксперту, который оценивал ответы, кто из них от какой системы. После снятия анонимности каждую ссылку на нормативный акт во всех четырёх ответах сверили по первоисточнику. Оценка шла по пяти критериям, максимум 10 баллов за каждый, итог — из 50.

Вопрос был такой: «В российском корпоративном и налоговом праве. Есть ли необходимость в какой-либо регистрации обособленного подразделения (не филиала), если компания начинает помимо основной деятельности заниматься образовательной деятельностью. Дай ответ со ссылками на законодательство».

Вопрос сформулирован не случайно так узко — в нём сходятся два института. Первый — обязанность образовательных организаций создать отдельное структурное подразделение по закону об образовании (273-ФЗ). Второй — обособленное подразделение по налоговому праву: по общему правилу, стационарное рабочее место вне адреса регистрации компании ставится на учёт в налоговой по Налоговому кодексу (НК РФ) — и это отдельный от филиала институт, филиалы и представительства регистрируются по Гражданскому кодексу (ГК РФ). Слова «не филиал» в вопросе — проверка, различает ли модель оба института или сваливает их в один ответ.

Важная оговорка: это один тест на одном вопросе, а не регулярный рейтинг. На другом юридическом вопросе расстановка мест вполне может быть другой — мы не выдаём результат этого раза за постоянную характеристику ни одной из четырёх систем, включая свою.

Результаты: 38 против 37, 36 и 33

Первое место у Claude Opus 4.8 — 38 баллов из 50. ГранаЙ на втором месте — 37. Gemini 2.5 Flash Ext. — 36. ChatGPT Instant — 33. Разрыв между первым и вторым местом — всего 1 балл.

1 балл из 50
разница между Claude Opus 4.8 (38) и ГранаЙ (37) в этом слепом тесте на одном юридическом вопросе, 7 июля 2026 года
Критерий (макс. 10) Claude Opus 4.8 ГранаЙ Gemini 2.5 Flash Ext. ChatGPT Instant
Точность реквизитов НПА 7 7 6 8
Охват темы 7 9 9 5
Актуальность правовой базы 10 6 6 6
Понятность клиенту 7 9 10 5
Отсутствие содержательных ошибок 7 6 5 9
Итого (из 50) 38 37 36 33

Ни одна система не выигрывает по всем пяти критериям сразу. Opus — лучший по актуальности с большим отрывом (10 против 6 у всех остальных), но не лидирует ни по охвату, ни по понятности. ГранаЙ и Gemini делят первое место по охвату темы (9 из 10). Gemini — лучший по понятности клиенту (10), но худший по отсутствию ошибок (5). ChatGPT — лучший по отсутствию ошибок (9), но единственный аутсайдер сразу по двум осям: и по охвату темы (5), и по понятности клиенту (5).

Почему победил Claude Opus 4.8

Opus обошёл остальные три системы за счёт одного критерия — актуальности правовой базы: 10 баллов из 10 против 6 у ГранаЙ, Gemini и ChatGPT. По остальным четырём критериям разница между Opus и вторым местом на каждой оси — от 0 до 2 баллов.

Единственная модель, которая учла постановление Правительства РФ №52 от 27 января 2026 года, — оно продлевает действие постановления №1490 от 18 сентября 2020 года о лицензировании образовательной деятельности до 1 сентября 2032 года, — это Claude Opus 4.8. Отсюда и максимальный балл по актуальности: только он опирался на действующую редакцию, остальные три системы — на более раннюю.

Это структурный риск для любого инструмента с обучением на срезе данных, включая наш: если база не сверяется в момент ответа, модель уверенно расскажет то, что уже не действует. У нас по этому критерию тоже 6 из 10 — как у Gemini и ChatGPT: общий риск для трёх систем из четырёх, а не индивидуальная слабость.

Почему ChatGPT занял последнее место, почти не ошибившись

ChatGPT Instant получил лучший балл в тесте по критерию «отсутствие содержательных ошибок» — 9 из 10, выше, чем у нас и у Opus. При этом по итоговой сумме он последний — 33 из 50. Причина — охват темы и понятность клиенту всего по 5 из 10 каждый: ответ безопасный, но обходит стороной конкретику.

В ответе ChatGPT почти не за что зацепиться как за ошибку — и почти нечем воспользоваться на практике: ни сроков, ни номеров форм, ни размеров санкций. Модель не называла детали, которые можно перепутать, и тем самым избежала ошибок — но вместе с ними из ответа исчезла и практическая польза: юристу нужен не только результат «без ошибок», а конкретный следующий шаг.

Отсюда рабочий вывод для любого, кто оценивает ИИ-инструмент по юридическим вопросам: «в ответе нет ошибок» и «ответом можно воспользоваться» — это два разных критерия, и высокий балл по первому не гарантирует высокий балл по второму. Хороший тест смотрит на оба.

Что тест показал про ГранаЙ

Второе место из четырёх — 37 баллов из 50, на 1 балл позади Claude Opus 4.8. Лидерства по всем критериям сразу нет: по охвату темы и понятности клиенту мы в верхней части списка, по актуальности правовой базы и по отсутствию содержательных ошибок — в нижней, вместе с частью тех же конкурентов.

Охват темы — 9 из 10, наравне с Gemini, выше Opus (7) и ChatGPT (5). Понятность клиенту — тоже 9 из 10: здесь нас обходит только Gemini (10), а Opus (7) мы, наоборот, опережаем. По точности реквизитов НПА — 7 из 10, наравне с Opus, позади ChatGPT (8) и впереди Gemini (6). Ни по одному из этих трёх критериев мы не занимаем единоличное первое место — и не будем утверждать обратное.

Два места, где результат слабее. Актуальность правовой базы — 6 из 10, столько же, сколько у Gemini и ChatGPT, заметно позади Opus (10) — причины разобраны выше, и это общая для рынка проблема, а не только наша. Отсутствие содержательных ошибок — тоже 6 из 10, не лучший результат в тесте. Разбор конкретных ошибок из этого прогона мы забрали в работу над продуктом; в статье сознательно не разбираем, какая именно норма была неточной — это внутренняя доработка, а не материал для публичного сравнения моделей.

Что это значит для юриста, который выбирает инструмент

Универсального победителя по всем пяти критериям в этом тесте нет ни у кого. Если для вас важнее всего актуальность правовой базы — это ось, где отрыв Opus реален и велик. Если важнее охват и понятность для клиента без юридического образования — здесь сильнее ГранаЙ и Gemini. Если самое важное — вообще не совершить фактическую ошибку ценой почти любой конкретики — в этом тесте так вёл себя ChatGPT.

Расстановка мест в этом одном тесте не переносится на другой вопрос, тем более из другой отрасли права. Смысл не в итоговой таблице, а в том, чтобы применить ту же логику проверки к своим типовым вопросам.

Чек-лист: на что смотреть при выборе ИИ-инструмента для юридической работы

  • Можно ли открыть источник, на который ссылается ответ, а не только поверить формулировке.
  • Совпадает ли база знаний модели с текущим состоянием законодательства, а не с тем, что было актуально год-два назад.
  • Есть ли в ответе конкретика — сроки, формы, размеры санкций, — которой можно воспользоваться, а не только общие фразы без деталей.
  • Проверяли ли вы инструмент на своих типовых вопросах вслепую, а не полагались на чужой тест — в том числе на этот.

Тот же принцип работает и в других продуктах портфеля. В ЭдПрав, нашем ИИ-юристе для образовательных проектов, читатель тоже почти никогда не юрист по образованию — вопрос понятности стоит так же остро. В iNPLES.io и iNPLES.pro, где мы строим защиту интеллектуальной собственности и поиск по товарным знакам, ценность результата определяется не уверенностью формулировки, а тем, можно ли проверить, на что он ссылается. В ataClick, нашем сервисе заверения скриншотов для бразильского рынка, — тот же принцип в чистом виде: важно не оформление, а то, что зафиксированное можно однозначно перепроверить.

Обсудить похожую задачу с Inples LTS

Строим LegalTech-продукты и внедряем ИИ в юридические процессы — от MVP до продакшена. Если в вашей компании стоит похожая задача — оценка или настройка ИИ-инструмента для юридической работы, — опишите её нам.

Обсудить проект · услуги Inples LTS · hello@inples.ru

Статья подготовлена на основе результатов одного слепого теста, проведённого 7 июля 2026 года, и законодательства, актуального на эту дату. Материал не заменяет юридическую консультацию по вашей конкретной ситуации. Для решения по вашему кейсу рекомендуем обратиться к юристу или напрямую в Inples LTS.