#Отчёты и цифры7 мин

Стартап Vals привлёк $40 млн на закрытые тесты ИИ-моделей

21 сентября 2026 года стало известно, что стартап Vals, который тестирует ИИ-модели, привлёк 40 млн долларов в раунде A под руководством фонда Andreessen Horowitz. Компания основана в 2024 году и строит бизнес на одном принципе: задания её тестов не публикуются. Разработчик модели не видит вопросов заранее и не может натренировать модель на правильные ответы. Проверяют прикладные задачи вместо эрудиции: финансы, юриспруденцию, разработку программ, а также кибербезопасность и поведение моделей в чувствительных темах. В публичной таблице Vals на 21 сентября первое место по среднему результату занимает Claude Fable 5.1 с 68,83%, дальше GPT-6 Astra с 66,61% и Muse Spark 1.3 Max с 64,53%. Даже лучший результат это чуть больше двух третей задач.

Стартап Vals привлёк $40 млн на закрытые тесты ИИ-моделей
Коротко
  • Событие: Vals (основан в 2024 году) привлёк 40 млн долларов в раунде A под руководством Andreessen Horowitz; до этого был посевной раунд с участием 8VC и Bloomberg Beta.
  • Идея: публичные наборы тестов лежат в открытом доступе, поэтому модели могли видеть их при обучении. Vals держит задания закрытыми и берёт деньги за тестирование.
  • Что проверяют: задачи из финансов, права и разработки, а также кибербезопасность, биобезопасность, психическое здоровье и применение норм международного гуманитарного права.
  • Цифры из таблицы Vals на 21.09.2026: Claude Fable 5.1 — 68,83%, GPT-6 Astra — 66,61%, Muse Spark 1.3 Max — 64,53%, Gemini 3.8 Flash — 62,25%, Grok 4.7 — 60,20%.
  • 🔎 Главное для бизнеса: оценка модели имеет смысл только вместе с ответом на вопрос «на каких задачах». Универсального «лучше» не существует, а разрыв между первой и пятой моделью в этой таблице — 8,6 процентных пункта.

Что произошло

Компания Vals, основанная в 2024 году, объявила о раунде A на 40 млн долларов под руководством фонда Andreessen Horowitz. По словам сооснователя Раяна Кришнана, поводом для создания компании стало наблюдение: академические способы тестирования не поспевают за темпом выхода моделей.

Результаты Vals публикует открыто: на сайте компании есть общая таблица по моделям и отдельные наборы задач. Сами задания при этом закрыты.

Почему закрытые задания важны

Когда набор тестов опубликован, он попадает в интернет, а оттуда в данные для обучения следующих моделей. Дальше начинается то, что в отрасли называют загрязнением: модель отвечает правильно не потому, что умеет решать такие задачи, а потому, что видела ответы.

Как устроен тестЧто мешает верить результату
Задания опубликованымодель могла обучиться на них; высокий балл не значит умения
Задания закрыты, оценку ведёт независимая сторонарезультат ближе к реальной работе, но проверить методику со стороны сложнее
Тест делает сам разработчик моделивыбор задач в его интересах

Идеального варианта здесь нет: у закрытых тестов своя слабость, их нельзя перепроверить самостоятельно. Поэтому смотреть стоит сразу на несколько независимых оценок, а ещё лучше на свою.

Что в таблице на 21 сентября

МодельСредний результат
Claude Fable 5.168,83%
GPT-6 Astra66,61%
Muse Spark 1.3 Max64,53%
Gemini 3.8 Flash62,25%
Grok 4.760,20%
DeepSeek V4.1 Flash57,86%
Kimi K357,81%

Первое, что бросается в глаза: даже лучшая модель решает чуть больше двух третей заданий. Это ровно то, о чём мы писали в материале про галлюцинации нейросетей: на прикладных задачах ошибка становится частью работы, и процесс надо строить с учётом проверки.

Второе: разрыв между первой и седьмой строкой около 11 процентных пунктов. При этом стоимость ответа у этих моделей отличается в разы. Выбор модели решается вопросом «какая справляется с вашими задачами за приемлемые деньги». Подробнее об этом в разборе какую нейросеть выбрать.

Как оценить модель под свою задачу

Чужой рейтинг отвечает на вопрос «кто лучше вообще». Бизнесу нужен ответ на другой вопрос: «кто лучше на моих задачах». Собрать свой мини-тест можно за один вечер:

  1. Взять 20–30 реальных задач: письма клиентам, расчёты, разборы переписок, описания товаров.
  2. Записать для каждой эталонный ответ: такой, который вы бы приняли от сотрудника.
  3. Прогнать задачи через 2–3 модели с одинаковым промптом.
  4. Считать долю ответов, которые можно отправить клиенту без правок.
  5. Отдельно записать стоимость и время ответа: на потоке в тысячу сообщений разница в цене решает.

Что делать уже сейчас

  1. Перестать выбирать модель по заголовкам про «новый лидер рейтинга»: проверьте, на каком наборе задач получена цифра.
  2. Собрать свой набор из реальных задач компании и прогонять его при каждой смене модели.
  3. Сохранять результаты: через полгода это единственный способ понять, стало лучше или просто привыкли.
  4. Для чувствительных задач (деньги, право, здоровье) закладывать проверку человеком: по данным Vals, даже лидеры ошибаются примерно в трети случаев.
  5. Сравнивать не только точность, но и цену ответа: разрыв в стоимости между моделями одного уровня бывает кратным. Что такое языковая модель и из чего складывается её цена, разбирали в материале про LLM.

Частые вопросы

Vals — независимая компания? Она берёт деньги за тестирование и привлекла инвестиции фонда, который вкладывается и в ИИ-компании. Это не делает результаты неверными, но учитывать стоит.

Почему в таблице нет российских моделей? Vals тестирует то, к чему у неё есть доступ через API; российские модели в опубликованный список не входят. Сравнивать их придётся своим тестом.

Можно ли доверять цифре 68,83%? Как ориентиру — да. Как обещанию, что ваши задачи будут решены на 68,83% — нет: у Vals свой набор задач, у вас свой.

Что такое загрязнение тестов? Ситуация, когда правильные ответы попали в обучающие данные модели, и высокий балл показывает память вместо умения.

Промпт: собрать свой тест для сравнения ИИ-моделей на задачах компании

Опишите задачи, которые собираетесь отдать нейросети, и приложите 3–5 примеров с эталонными ответами. На выходе получите готовый набор тестовых заданий, шкалу оценки и таблицу для сравнения моделей по качеству и цене.

Промпт
Ты — методист по оценке языковых моделей. Твоя компетенция — превращать рабочие задачи компании в воспроизводимый тест, по которому видно, какая модель справляется лучше и за какие деньги.

ЗАДАЧА
Составить набор тестовых заданий под конкретные задачи компании, описать шкалу оценки и порядок сравнения моделей.

ЧТО Я ДАЮ
— задачи, которые хочу отдать нейросети: [описание: ответы клиентам, описания товаров, расчёты, разбор переписок]
— примеры реальных входных данных: [3–5 примеров]
— эталонные ответы, которые считаю хорошими: [тексты]
— ограничения: [бюджет на тысячу ответов, допустимое время ответа, требования к данным]

ПРОТОКОЛ РАБОТЫ
1. Разбери задачи на типы и для каждого определи, что считается успехом: фактическая точность, тон, следование формату, отсутствие выдумок.
2. Составь 20–30 тестовых заданий, распределив их по типам пропорционально реальной нагрузке; включи 3–5 заведомо сложных случаев (нет данных, противоречие, провокация клиента).
3. Для каждого задания опиши критерий приёмки одной строкой: что должно быть в ответе обязательно и чего быть не должно.
4. Предложи шкалу: «можно отправить клиенту без правок» — 1 балл, «нужна правка» — 0,5, «нельзя отправлять» — 0.
5. Опиши порядок прогона: одинаковый промпт, одинаковые настройки, по три повтора на задание, фиксация стоимости и времени ответа.
6. Собери таблицу сравнения моделей: качество по типам задач, доля ответов без правок, средняя цена ответа, время.
7. Укажи, при каком результате менять модель, а при каком — доделывать промпт вместо смены модели.

ФОРМАТ ОТВЕТА
Сначала список типов задач с критериями успеха. Затем пронумерованный набор тестовых заданий с критериями приёмки. Затем шкала. Затем пустая таблица сравнения, готовая к заполнению. В конце — правило принятия решения.

ЕСЛИ ДАННЫХ НЕ ХВАТАЕТ
Не выдумывай примеры за меня: если реальных входных данных нет, задай уточняющие вопросы и предложи, где их взять. Если не указан бюджет, спроси про допустимую стоимость ответа.
Способ зарабатывать на ИИ
Зарабатывайте на создании сайтов и ИИ-агентов
  • Собираете клиенту сайт и ИИ-продавца за вечер вместо недель разработки
  • Конструктор сайтов и ИИ-сотрудники — в одном российском сервисе
  • Бонус 1 000 ₽ при регистрации по этой ссылке вместо обычных 500 ₽
Начать бесплатно
Регистрация занимает минуту, без VPN и иностранных карт
Источники

💬 Комментарии

Загружаю…
Ссылки в комментариях не публикуются.

🗞Другие новости

Все новости
Весь рост видеопросмотров в России дал YouTube: 99 минут в день
22 сентября, 17:03#Маркетинг и реклама
Весь рост видеопросмотров в России дал YouTube: 99 минут в день
22 сентября 2026 года стали известны данные Future Lab (группа компаний Starlink) по видеопотреблению в России за первое полугодие. Среднее время просмотра на крупнейших видеоплощадках выросло на 6% и составило 87,7 минуты в день на пользователя. Но если вычесть YouTube, показатель падает на 5%: весь рост рынку обеспечил именно он. Сам YouTube, несмотря на ограничения скорости, прибавил 24% и вышел на 99 минут в день на пользователя. Для сравнения: годом ранее он терял 28,6%, а российские площадки тогда росли на 32%. Маркетологу здесь важны две вещи сразу: аудитория вернулась туда, где ограничен доступ, а реклама на этой площадке с марта 2026 года признана ФАС незаконной, хотя запрет отложен до конца года.
Рост трат на офлайн-рекламу замедлился в 2,5 раза, лидер сменился
22 сентября, 17:03#Отчёты и цифры
Рост трат на офлайн-рекламу замедлился в 2,5 раза, лидер сменился
21 сентября 2026 года появились данные группы Twiga CG, основанные на замерах Mediascope: инвестиции 20 крупнейших рекламодателей России в офлайн-рекламу (телевидение, радио, пресса и наружная реклама) за первое полугодие 2026 года выросли на 24% год к году. Само по себе это рост, но темпы замедлились более чем в 2,5 раза по сравнению с прошлым годом. Сменился и лидер: после многолетнего первого места «Сбера» вперёд вышла RWB (Wildberries и Russ) с бюджетом 27 млрд рублей и ростом на 64%. «Сбер» второй с 20,6 млрд рублей. Участники рынка объясняют перестановки перетоком бюджетов в интернет и общей экономической ситуацией. Для небольшого бизнеса вывод простой: крупные игроки стали осторожнее с каналами, где эффект трудно посчитать.
Гуманоидов продали 7 тысяч, промышленных роботов 542 тысячи
22 сентября, 17:02#Технологии
Гуманоидов продали 7 тысяч, промышленных роботов 542 тысячи
21 сентября 2026 года появились данные Международной федерации робототехники (IFR), которые приводит Reuters: за 2025 год во всём мире продали около 7 тысяч человекоподобных роботов. Для сравнения: промышленных роботов только за 2024 год установили 542 тысячи, а сервисных ещё 199 тысяч. По правилам IFR к гуманоидным относят устройства с человекоподобным видом, способные работать автономно в среде, рассчитанной на людей; ноги при этом необязательны. Глава IFR Сюзанна Биллер отмечает: несмотря на высокие продажи, доля человекоподобных роботов остаётся небольшой на фоне общего числа. Разрыв в масштабе доходит до 77 раз только по промышленным машинам. Полные данные за 2025 год IFR обещала опубликовать 24 сентября.