Что произошло
Компания Vals, основанная в 2024 году, объявила о раунде A на 40 млн долларов под руководством фонда Andreessen Horowitz. По словам сооснователя Раяна Кришнана, поводом для создания компании стало наблюдение: академические способы тестирования не поспевают за темпом выхода моделей.
Результаты Vals публикует открыто: на сайте компании есть общая таблица по моделям и отдельные наборы задач. Сами задания при этом закрыты.
Почему закрытые задания важны
Когда набор тестов опубликован, он попадает в интернет, а оттуда в данные для обучения следующих моделей. Дальше начинается то, что в отрасли называют загрязнением: модель отвечает правильно не потому, что умеет решать такие задачи, а потому, что видела ответы.
| Как устроен тест | Что мешает верить результату |
|---|---|
| Задания опубликованы | модель могла обучиться на них; высокий балл не значит умения |
| Задания закрыты, оценку ведёт независимая сторона | результат ближе к реальной работе, но проверить методику со стороны сложнее |
| Тест делает сам разработчик модели | выбор задач в его интересах |
Идеального варианта здесь нет: у закрытых тестов своя слабость, их нельзя перепроверить самостоятельно. Поэтому смотреть стоит сразу на несколько независимых оценок, а ещё лучше на свою.
Что в таблице на 21 сентября
| Модель | Средний результат |
|---|---|
| Claude Fable 5.1 | 68,83% |
| GPT-6 Astra | 66,61% |
| Muse Spark 1.3 Max | 64,53% |
| Gemini 3.8 Flash | 62,25% |
| Grok 4.7 | 60,20% |
| DeepSeek V4.1 Flash | 57,86% |
| Kimi K3 | 57,81% |
Первое, что бросается в глаза: даже лучшая модель решает чуть больше двух третей заданий. Это ровно то, о чём мы писали в материале про галлюцинации нейросетей: на прикладных задачах ошибка становится частью работы, и процесс надо строить с учётом проверки.
Второе: разрыв между первой и седьмой строкой около 11 процентных пунктов. При этом стоимость ответа у этих моделей отличается в разы. Выбор модели решается вопросом «какая справляется с вашими задачами за приемлемые деньги». Подробнее об этом в разборе какую нейросеть выбрать.
Как оценить модель под свою задачу
Чужой рейтинг отвечает на вопрос «кто лучше вообще». Бизнесу нужен ответ на другой вопрос: «кто лучше на моих задачах». Собрать свой мини-тест можно за один вечер:
- Взять 20–30 реальных задач: письма клиентам, расчёты, разборы переписок, описания товаров.
- Записать для каждой эталонный ответ: такой, который вы бы приняли от сотрудника.
- Прогнать задачи через 2–3 модели с одинаковым промптом.
- Считать долю ответов, которые можно отправить клиенту без правок.
- Отдельно записать стоимость и время ответа: на потоке в тысячу сообщений разница в цене решает.
Что делать уже сейчас
- Перестать выбирать модель по заголовкам про «новый лидер рейтинга»: проверьте, на каком наборе задач получена цифра.
- Собрать свой набор из реальных задач компании и прогонять его при каждой смене модели.
- Сохранять результаты: через полгода это единственный способ понять, стало лучше или просто привыкли.
- Для чувствительных задач (деньги, право, здоровье) закладывать проверку человеком: по данным Vals, даже лидеры ошибаются примерно в трети случаев.
- Сравнивать не только точность, но и цену ответа: разрыв в стоимости между моделями одного уровня бывает кратным. Что такое языковая модель и из чего складывается её цена, разбирали в материале про LLM.
Частые вопросы
Vals — независимая компания? Она берёт деньги за тестирование и привлекла инвестиции фонда, который вкладывается и в ИИ-компании. Это не делает результаты неверными, но учитывать стоит.
Почему в таблице нет российских моделей? Vals тестирует то, к чему у неё есть доступ через API; российские модели в опубликованный список не входят. Сравнивать их придётся своим тестом.
Можно ли доверять цифре 68,83%? Как ориентиру — да. Как обещанию, что ваши задачи будут решены на 68,83% — нет: у Vals свой набор задач, у вас свой.
Что такое загрязнение тестов? Ситуация, когда правильные ответы попали в обучающие данные модели, и высокий балл показывает память вместо умения.
