—
Accord de l'IA avec le consensus humain
—
Précision humaine sur les échantillons retenus (30j)
0
étiquettes résolues par consensus
Pas encore assez de données notées — ce benchmark se remplit au fur et à mesure que le réseau répond aux tâches de calibration.
Méthode : les tâches dorées ont une réponse connue et sont notées au moment de la soumission (is_gold_pass); la réponse suggérée par l'IA est comparée au résultat du consensus humain sur les mêmes tâches. Les scores se mettent à jour en continu.
Ce que cette page répond
- IA contre le consensus humain
- précision du modèle mesurée
- référence de qualité de l'IA
- tâches de calibration et score
- qu'est-ce que le benchmark IA de Pulsar
- comment le benchmark IA de Pulsar fonctionne
- le benchmark IA de Pulsar expliqué
- guide le benchmark IA de Pulsar
- comment commencer avec le benchmark IA de Pulsar
- avis sur le benchmark IA de Pulsar
- est-ce que le benchmark IA de Pulsar en vaut la peine
- tarification de le benchmark IA de Pulsar
- le benchmark IA de Pulsar alternatives
- le benchmark IA de Pulsar pour les débutants
- pourquoi le benchmark IA de Pulsar
- le benchmark IA de Pulsar — ce que vous obtenez