Vals, поддерживаемая Andreessen Horowitz, стремится стать эталоном для бенчмаркинга ИИ

📌 Vals AI надеется сделать бенчмаркинг искусственного интеллекта более нейтральным и заслуживающим доверия ресурсом в мире, который все больше наводняется моделями искусственного интеллекта.

Реклама
Полезное

Расчётный счёт для бизнеса — 3 мес бесплатно, потом скидка 50%

Счёт для стартапа

Партнёрский материал. Мы получаем вознаграждение от партнёров.

Стартап Vals при поддержке фонда Andreessen Horowitz разрабатывает систему оценки языковых моделей, которая заменит существующие тесты вроде MMLU и HumanEval. Компания предлагает бенчмарки, приближённые к реальным задачам бизнеса, а не к абстрактным академическим головоломкам.

📚

Рынок оценки ИИ-моделей сейчас фрагментирован: MMLU проверяет школьные знания, HumanEval — программирование, LMSYS Chatbot Arena — предпочтения пользователей. Каждый тест меряет своё, и суммарный рейтинг не показывает, насколько модель полезна конкретной компании. Andreessen Horowitz — один из крупнейших венчурных фондов Кремниевой долины, управляет активами около 42 млрд долларов и активно инвестирует в инфраструктуру искусственного интеллекта.

Проблема «игры под тест» известна давно: разработчики «натаскивают» модели на популярные бенчмарки, и показатели перестают коррелировать с реальной производительностью.

🧠 Анализ SmartNewsAI

Vals хочет стать главным эталоном для измерения возможностей искусственного интеллекта Когда выбираете новый смартфон, вы смотрите на результаты в синтетических тестах. Когда компания закупает серверы — сравнивает производительность по единым стандартам. С искусственным интеллектом всё сложнее: до сих пор нет общепризнанного способа понять, какая модель действительно умнее, быстрее и надёжнее. Проект Vals, который финансирует влиятельный венчурный фонд Andreessen Horowitz, объявил о намерении закрыть этот пробел.

Зачем рынку новый бенчмарк

Существующие методы оценки ИИ — от теста Turing до современных академических наборов задач — давно критикуют за фрагментарность. Одни измеряют скорость ответа, другие — точность в узких сценариях, третьи вообще не учитывают практическую пользу для бизнеса. Разработчики моделей нередко «подгоняют» архитектуру под конкретные тесты, не улучшая при этом реальные способности. Покупатели же — от стартапов до корпораций — вынуждены верить маркетинговым заявлениям или проводить дорогостоящие собственные испытания.

Универсальный эталон, если Vals его создаст, позволит сравнивать модели «яблоки с яблоками». Это особенно важно сейчас, когда ИИ-индустрия переживает всплеск: каждая неделя приносит анонсы новых чат-ботов, генеративных моделей и корпоративных решений. Без прозрачной метрики рынок рискует превратиться в хаос несопоставимых обещаний.

Кто за этим стоит и что получит

Поддержка Andreessen Horowitz — серьёзный сигнал для рынка. Фонд известен ранними вложениями в технологии, которые определяют облик целых отраслей, от социальных сетей до криптовалют. Интерес к бенчмаркингу ИИ означает, что инвесторы хотят снизить риски и получить инструмент для объективного отбора проектов. Для Vals это шанс занять нишу, аналогичную той, что Jahrzehnte назад закрепили за собой компании в области антивирусных тестов или оценки кредитного рейтинга.

Владелец стандарта получает влияние на направление развития технологии и потенциально — устойчивый поток доходов от лицензирования методологии.

Как это коснётся обычных людей

Когда стандартизированная оценка станет нормой, выбор ИИ-инструментов упростится. Представьте: компания ищет сервис для обработки клиентской поддержки. Вместо месяца пилотных проектов она смотрит на рейтинг Vals по нужным параметрам — скорость, точность, стоимость ошибки — и принимает решение за дни. Сокращение времени и рисков напрямую скажется на цене услуг для конечного пользователя.

Работникам категорий, которым грозит автоматизация, понадобится прозрачный способ понять, что конкретно умеет ИИ-кандидат на их должность. Эталон поможет отделить реальную угрозу от маркетингового шума и сосредоточиться на развитии действительно востребованных навыков. Главное рискованное место — кто определяет, что важно. Методология бенчмарка формирует стимулы для разработчиков. Если измерять только скорость, страдает безопасность. Если только точность — страдает доступность.

Vals предстоит убедить рынок в своей независимости и полноте подхода.

Что будет дальше

Успех Vals зависит от двух факторов — признания со стороны ведущих создателей ИИ-моделей и доверия крупных заказчиков. Без первого эталон останется теоретическим упражнением, без второго — коммерчески несостоятельным. Следующие месяцы покажут, удастся ли проекту, поддержанному одним из главных игроков венчурного рынка, стать тем самым «кембриджским тестом» для машинного разума — или его ждёт судьба десятков других попыток, которые рынок уже забыл.

Читать полностью на TechCrunch_AI →
Поделиться: Telegram VK

Читайте нас там, где удобно вам

Telegram-канал Яндекс.Дзен vc.ru

Получайте такие новости первым

Нейросеть-анализатор собирает, сопоставляет и анализирует новости каждые 15 минут — в одну понятную картину. Читаем, обсуждаем, делимся мнениями.

Вступить в Telegram

Бесплатно · Без спама · Отписка в 1 клик