—
Согласие ИИ с человеческим консенсусом
—
Точность людей на отложенных эталонах (30д)
0
меток разрешено консенсусом
Пока недостаточно оценённых данных — этот бенчмарк заполнится по мере ответов сети на калибровочные задания.
Метод: у эталонных заданий есть известный ответ, они оцениваются в момент ответа (is_gold_pass); предложенный ИИ ответ сравнивается с результатом человеческого консенсуса на тех же заданиях. Оценки обновляются постоянно.
На какие запросы отвечает эта страница
- ИИ против консенсуса людей
- измеренная точность модели
- бенчмарк качества ИИ
- калибровочные задачи и оценка
- что такое бенчмарк ИИ сети Pulsar
- как работает бенчмарк ИИ сети Pulsar
- бенчмарк ИИ сети Pulsar — разбор
- бенчмарк ИИ сети Pulsar — руководство
- с чего начать: бенчмарк ИИ сети Pulsar
- бенчмарк ИИ сети Pulsar отзывы
- стоит ли бенчмарк ИИ сети Pulsar
- бенчмарк ИИ сети Pulsar — цены
- бенчмарк ИИ сети Pulsar аналоги
- бенчмарк ИИ сети Pulsar для новичков
- зачем бенчмарк ИИ сети Pulsar
- бенчмарк ИИ сети Pulsar — что входит