HealthBench-Arena
HealthBench Arena 是一套面向医疗领域大语言模型的自动化评测平台。平台严格遵循 OpenAI HealthBench 论文的 Rubric-based Binary Scoring 方法论,通过"模型调用 → 裁判评分 → AI 解读"三步流水线,对多个大模型在医疗对话场景下的表现进行系统性量化评估。 支持 OpenAI、Anthropic、Google 三种 API 协议统一接入,内置 5 套官方评测题库(约 38,000 条题目),覆盖通用医疗对话、高难度临床推理、专家共识验证、真实临床实践及元评估校准五个层级。评分引擎实现论文原始公式(含长度调整),支持多裁判交叉验证取中位数,并提供教师模型自动生成通俗解读报告。
HealthBench-Arena 최신버젼 다운로드
최종 버전 다운로드 (.zip)// repository documentation
Was this content helpful?
(0 ratings)
