📌 Vals AI надеется сделать бенчмаркинг искусственного интеллекта более нейтральным и заслуживающим доверия ресурсом в мире, который все больше наводняется моделями искусственного интеллекта.
Расчётный счёт для бизнеса — 3 мес бесплатно, потом скидка 50%
Счёт для стартапаПартнёрский материал. Мы получаем вознаграждение от партнёров.
⚡
Стартап Vals при поддержке фонда Andreessen Horowitz разрабатывает систему оценки языковых моделей, которая заменит существующие тесты вроде MMLU и HumanEval. Компания предлагает бенчмарки, приближённые к реальным задачам бизнеса, а не к абстрактным академическим головоломкам.
📚
Рынок оценки ИИ-моделей сейчас фрагментирован: MMLU проверяет школьные знания, HumanEval — программирование, LMSYS Chatbot Arena — предпочтения пользователей. Каждый тест меряет своё, и суммарный рейтинг не показывает, насколько модель полезна конкретной компании. Andreessen Horowitz — один из крупнейших венчурных фондов Кремниевой долины, управляет активами около 42 млрд долларов и активно инвестирует в инфраструктуру искусственного интеллекта.
Проблема «игры под тест» известна давно: разработчики «натаскивают» модели на популярные бенчмарки, и показатели перестают коррелировать с реальной производительностью.
Vals хочет стать главным эталоном для измерения возможностей искусственного интеллекта Когда выбираете новый смартфон, вы смотрите на результаты в синтетических тестах. Когда компания закупает серверы — сравнивает производительность по единым стандартам. С искусственным интеллектом всё сложнее: до сих пор нет общепризнанного способа понять, какая модель действительно умнее, быстрее и надёжнее. Проект Vals, который финансирует влиятельный венчурный фонд Andreessen Horowitz, объявил о намерении закрыть этот пробел.
Зачем рынку новый бенчмарк
Существующие методы оценки ИИ — от теста Turing до современных академических наборов задач — давно критикуют за фрагментарность. Одни измеряют скорость ответа, другие — точность в узких сценариях, третьи вообще не учитывают практическую пользу для бизнеса. Разработчики моделей нередко «подгоняют» архитектуру под конкретные тесты, не улучшая при этом реальные способности. Покупатели же — от стартапов до корпораций — вынуждены верить маркетинговым заявлениям или проводить дорогостоящие собственные испытания.
Универсальный эталон, если Vals его создаст, позволит сравнивать модели «яблоки с яблоками». Это особенно важно сейчас, когда ИИ-индустрия переживает всплеск: каждая неделя приносит анонсы новых чат-ботов, генеративных моделей и корпоративных решений. Без прозрачной метрики рынок рискует превратиться в хаос несопоставимых обещаний.
Кто за этим стоит и что получит
Поддержка Andreessen Horowitz — серьёзный сигнал для рынка. Фонд известен ранними вложениями в технологии, которые определяют облик целых отраслей, от социальных сетей до криптовалют. Интерес к бенчмаркингу ИИ означает, что инвесторы хотят снизить риски и получить инструмент для объективного отбора проектов. Для Vals это шанс занять нишу, аналогичную той, что Jahrzehnte назад закрепили за собой компании в области антивирусных тестов или оценки кредитного рейтинга.
Владелец стандарта получает влияние на направление развития технологии и потенциально — устойчивый поток доходов от лицензирования методологии.
Как это коснётся обычных людей
Когда стандартизированная оценка станет нормой, выбор ИИ-инструментов упростится. Представьте: компания ищет сервис для обработки клиентской поддержки. Вместо месяца пилотных проектов она смотрит на рейтинг Vals по нужным параметрам — скорость, точность, стоимость ошибки — и принимает решение за дни. Сокращение времени и рисков напрямую скажется на цене услуг для конечного пользователя.
Работникам категорий, которым грозит автоматизация, понадобится прозрачный способ понять, что конкретно умеет ИИ-кандидат на их должность. Эталон поможет отделить реальную угрозу от маркетингового шума и сосредоточиться на развитии действительно востребованных навыков. Главное рискованное место — кто определяет, что важно. Методология бенчмарка формирует стимулы для разработчиков. Если измерять только скорость, страдает безопасность. Если только точность — страдает доступность.
Vals предстоит убедить рынок в своей независимости и полноте подхода.
Что будет дальше
Успех Vals зависит от двух факторов — признания со стороны ведущих создателей ИИ-моделей и доверия крупных заказчиков. Без первого эталон останется теоретическим упражнением, без второго — коммерчески несостоятельным. Следующие месяцы покажут, удастся ли проекту, поддержанному одним из главных игроков венчурного рынка, стать тем самым «кембриджским тестом» для машинного разума — или его ждёт судьба десятков других попыток, которые рынок уже забыл.
Читайте нас там, где удобно вам
Получайте такие новости первым
Нейросеть-анализатор собирает, сопоставляет и анализирует новости каждые 15 минут — в одну понятную картину. Читаем, обсуждаем, делимся мнениями.
Вступить в TelegramБесплатно · Без спама · Отписка в 1 клик
Комментарии
Оставить комментарий