モデルリーダーボードモデル Marketplace 評価トレーニングレンタル APIドキュメント

Language

評価スイート

ローカルLLMの品質を評価するためのコミュニティベンチマークスイート。APIから結果を送信してください。

すべて公式 LM-Eval runs Custom server-side coding knowledge math reasoning truthfulness writing

v1.0 · LM-Eval run

Massive Multitask Language Understanding via EleutherAI lm-evaluation-harness task mmlu, 5-shot, exact-match/accuracy style scoring.

knowledge0 件の記録

v1.0 · LM-Eval run

knowledge1 件の記録