
模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载SeedBench 是首个面向**种子科学Seed Science**的大语言模型多任务评测基准核心聚焦水稻育种场景覆盖基因信息检索、基因功能与调控分析、品种育种与农艺性状优化三大育种环节。本文以 OpenCompass 仓库中的 SeedBench 文档为主体结合数据集配置、加载器与评分器源码系统讲解 SeedBench 的任务构成、指标设计、配置方式与评测流程帮助你直接在本仓库中复现对任意模型的 SeedBench 评测。一、SeedBench 是什么为什么需要一个育种专用评测基准通用评测基准如 MMLU、GSM8K难以衡量模型在垂直科研领域的深层能力。SeedBench 由领域专家参与构建专门评估大语言模型在种子育种领域的专业表现覆盖三个核心育种阶段Gene Information Retrieval基因信息检索考察模型能否从文献中准确检索并定位基因相关信息Gene Function and Regulation Analysis基因功能与调控分析考察对基因功能、调控机制的理解与推理能力Variety Breeding with Agronomic Trait Optimization品种育种与农艺性状优化考察模型在品种选育与农艺性状优化方面的综合决策能力。SeedBench 拥有2,264 道专家验证题目横跨 11 种任务类型与 10 个子类别现阶段以水稻育种为代表性案例未来计划扩展至玉米、大豆、小麦等作物。这意味着它不仅是数据集更是一套可复现、可追踪的领域能力评估体系。在 OpenCompass 中SeedBench 已被完整接入数据集加载、推理配置、评分器注册均可在仓库中找到对应实现详见下文第三、四节你可以直接复用现成配置开展评测。二、数据集详情语料规模、问题构成与任务指标2.1 语料与问题规模SeedBench 的数据构成如下语料Corpus308,727 篇出版物经清洗后得到11 亿 tokens其中抽取279 个文档片段来自 113 篇文档作为阅读材料问题Questions共4,336 道覆盖 11 种任务类型中英双语经专家验证聚焦领域以水稻rice育种作为代表性案例。2.2 任务类型与评测指标SeedBench 按题型分为三大类共 11 种任务类型各类型配有专门的评测指标Type IDQuestion TypeMetricCountQAQA-1Multiple Choice单选题Accuracy354QA-2Multiple Answer多选题Macro-F1291QA-3Fill-in-the-Blank填空ROUGE-L426QA-4Generation生成ROUGE-L403SummarizationSUM-1Simple Summarization摘要ROUGE-L638SUM-2Key Information Extraction关键信息抽取ROUGE-L638Reading ComprehensionRC-1Multiple ChoiceAccuracy268RC-2Multiple AnswerMacro-F1212RC-3Fill-in-the-BlankROUGE-L424RC-4GenerationROUGE-L403RC-5Subcategory Classification子类分类Accuracy279注上表各类别数量相加恰为 4,336与Questions: 4,336的描述一致文档同时说明其中 2,264 道为专家验证题目。从指标设计可以看出 SeedBench 的评测层次Accuracy用于单选题与子类分类答案可精确判定Macro-F1用于多选题需同时衡量命中率与误报ROUGE-L用于填空、生成、摘要与信息抽取衡量模型输出与标准答案在词级/短语级上的匹配程度。这一题型-指标映射关系与 OpenCompass 配置文件中的evaluator字段一一对应详见下一节。三、OpenCompass 中的 SeedBench 配置从入口到核心参数3.1 配置入口seedbench_gen.pySeedBench 的评测配置位于 opencompass/configs/datasets/SeedBench/入口文件seedbench_gen.py使用 mmengine 的read_base继承机制引入真实数据集配置from mmengine.config import read_base with read_base(): # Default use LLM as a judge from .seedbench_gen_5d5ea1 import seedbench_datasets # noqa: F401, F403实际的数据集列表seedbench_datasets由 seedbench_gen_5d5ea1.py 构建。3.2 读取与推理配置配置首先定义了统一的 reader 与 infer 配置agri_reader_cfg dict( input_columns[instruction, question], output_columnanswer ) agri_infer_cfg dict( prompt_templatedict( typePromptTemplate, template{instruction}\n{question}\n ), retrieverdict(typeZeroRetriever), inferencerdict(typeGenInferencer) ) default_dataset_cfg { type: SeedBenchDataset, path: json, reader_cfg: agri_reader_cfg, infer_cfg: agri_infer_cfg, }关键点解读reader_cfg模型输入由instruction指令与question问题两列拼接而成输出列为answerprompt_template模板为{instruction}\n{question}\n即指令与问题以换行分隔直接拼接retriever使用ZeroRetriever即不引入额外上下文检索直接以零样本方式推理inferencer使用GenInferencer走生成式而非困惑度 PPL推理路径适合问答、摘要、生成类任务。3.3 任务级配置11 类题型与评估器映射dataset_configs将 11 种题型逐一映射到数据文件与评估器对应 README 中 QA/SUM/RC 的 Metric 列dataset_configs [ # 1-n {abbr: seedbench_1-1, data_file: 1-1.json, evaluator: AccEvaluator, pred_postprocessor: dict(typefirst_option_postprocess, optionsABCD)}, {abbr: seedbench_1-2, data_file: 1-2.json, evaluator: F1ScoreEvaluator, pred_postprocessor: dict(typemy_multiple_select_postprocess)}, {abbr: seedbench_1-3, data_file: 1-3.json, evaluator: AverageRougeScoreEvaluator}, {abbr: seedbench_1-4, data_file: 1-4.json, evaluator: RougeEvaluator}, # 2-n {abbr: seedbench_2-1, data_file: 2-1.json, evaluator: RougeEvaluator}, {abbr: seedbench_2-2, data_file: 2-2.json, evaluator: RougeEvaluator}, # 3-n {abbr: seedbench_3-1, data_file: 3-1.json, evaluator: AccEvaluator, pred_postprocessor: dict(typefirst_option_postprocess, optionsABCD)}, {abbr: seedbench_3-2, data_file: 3-2.json, evaluator: F1ScoreEvaluator, pred_postprocessor: dict(typemy_multiple_select_postprocess)}, {abbr: seedbench_3-3, data_file: 3-3.json, evaluator: AverageRougeScoreEvaluator}, {abbr: seedbench_3-4, data_file: 3-4.json, evaluator: RougeEvaluator}, {abbr: seedbench_3-5, data_file: 3-5.json, evaluator: AccScoreStr_Evaluator}, ]可以看到1-x对应 README 中的QA组QA-1 单选题 →AccEvaluatorQA-2 多选题 →F1ScoreEvaluatorQA-3 填空 →AverageRougeScoreEvaluatorQA-4 生成 →RougeEvaluator2-x对应Summarization组RougeEvaluator3-x对应Reading Comprehension组RC-1/2/3/4 与 QA 组同构RC-5 子类分类 →AccScoreStr_Evaluator单选题与子类分类任务通过pred_postprocessor做输出规范化单选题用first_option_postprocess取 ABCD 中首个选项多选题用my_multiple_select_postprocess将ABC规范为A, B, C形式。3.4 零样本 / 单样本双设置配置最后通过两层循环生成完整的seedbench_datasets每个题型同时提供zero-shot 与 one-shot 两种评测设置seedbench_datasets [] for stage in [zero-shot,one-shot]: for config in dataset_configs: eval_cfg dict(evaluatordict(typeconfig[evaluator])) if pred_postprocessor in config: eval_cfg[pred_postprocessor] config[pred_postprocessor] data_file f{stage}/{config[data_file]} abbr_name f{config[abbr]}_{stage} seedbench_datasets.append( dict( typeSeedBenchDataset, abbrabbr_name, data_filesdata_file, pathopencompass/seedbench, reader_cfgagri_reader_cfg, infer_cfgagri_infer_cfg, eval_cfgeval_cfg ) )因此最终可用的数据集缩写为seedbench_1-1_zero-shot、seedbench_1-1_one-shot、seedbench_3-5_one-shot等共22 个。这些abbr可以直接作为python run.py --datasets的参数使用见第五节。四、源码级解读数据加载与评分器实现4.1 数据集加载器 SeedBenchDatasetSeedBench 的加载器实现在 opencompass/datasets/SeedBench.py 中并已通过 opencompass/datasets/init.py 注册导出LOAD_DATASET.register_module() class SeedBenchDataset(BaseDataset): staticmethod def load(data_files: str, path: str, split: str None, **kwargs) - datasets.Dataset: path get_data_path(path) if environ.get(DATASET_SOURCE) ModelScope: from modelscope import MsDataset dataset MsDataset.load(path, subset_namedefault, splitsplit, data_filesdata_files, **kwargs) else: dataset datasets.load_dataset(path, data_filesdata_files, **kwargs) ... return dataset[split]实现要点通过get_data_path解析实际数据路径支持本地数据目录支持双数据源当环境变量DATASET_SOURCEModelScope时走 ModelScope 的MsDataset.load否则默认走 Hugging Face 的datasets.load_dataset两处均可指定data_files如zero-shot/1-1.json与split若未指定split自动取数据集的第一个 split。4.2 多选题 Macro-F1 评分器 F1ScoreEvaluatorREADME 中 QA-2 / RC-2 的指标是 Macro-F1对应源码中的F1ScoreEvaluator继承自F1Evaluator。其核心逻辑是对预测与参考答案做 A-D 选项的集合交并运算逐样本计算 precision / recall / F1再汇总得到总体 F1for hyp, ref in zip(predictions, references): hyp re.sub(r[^A-Da-d,], , hyp.lower()) ref re.sub(r[^A-Da-d,], , ref.lower()) ref_set set(ref.split(,)) hyp_set set(hyp.split(,)) ... sample_tp len(hyp_set.intersection(ref_set)) sample_fp len(hyp_set - ref_set) sample_fn len(ref_set - hyp_set) ... sample_f1 (2 * sample_precision * sample_recall) / (sample_precision sample_recall) ...同时配置中为多选题注册了专门的后处理函数my_multiple_select_postprocess从模型输出中提取全部大写字母、去重排序后以,连接如ABC→A, B, C保证集合运算的输入规范性。4.3 填空 / 摘要 / 生成 ROUGE-L 评分器填空QA-3、RC-3与摘要/信息抽取SUM-1、SUM-2、生成QA-4、RC-4类任务使用 ROUGE-L 系评分器RougeEvaluator直接对生成结果计算 ROUGE-L来自 OpenCompass 通用评估器AverageRougeScoreEvaluator源码AverageRougeEvaluator面向填空类任务做了精细化处理——先剔除输出中形如正确答案/correct answer: 的冗余前缀随后用jieba 中文分词后调用rouge_chinese的Rouge计算rouge-l的 F 值并支持按逗号切分多词项、逐项对齐后取平均分def rouge_score(hyps, refs): hyps [ .join(jieba.cut(h)) for h in hyps] refs [ .join(jieba.cut(r)) for r in refs] rouge_scores Rouge().get_scores(hyps, refs) rouge_ls [score[rouge-l][f] for score in rouge_scores] average_rouge_l sum(rouge_ls) / len(rouge_ls) return {score: average_rouge_l * 100}可见 SeedBench 的中文/生物学术语匹配依赖中文分词质量这也是该项目针对领域语料专门设计评分链路的原因。4.4 子类分类评分器 AccScoreStr_EvaluatorRC-5Subcategory Classification使用AccScoreStr_Evaluator采用字符串包含匹配判定正确性只要标准答案字符串出现在模型输出中忽略大小写即判对输出ACCStrScore百分制分数is_correct 1 if ref.strip().lower() in hyp.strip().lower() else 0这种宽松匹配适合子类名可能以多种措辞出现的情况。五、数据源与本地化配置SeedBench 数据集在 OpenCompass 中注册于 opencompass/utils/datasets_info.py# SeedBench opencompass/seedbench: { ms_id: y12869741/SeedBench, hf_id: yj12869741/SeedBench, local: ./data/SeedBench, },Hugging Face数据集 IDyj12869741/SeedBenchModelScope数据集 IDy12869741/SeedBench评测时设置环境变量DATASET_SOURCEModelScope即可切换见 4.1 节本地路径./data/SeedBench可提前下载后放置配置会优先解析本地数据。因此你可以在三种数据来源之间自由切换默认从 Hugging Face 拉取需要境内加速时改用 ModelScope或直接使用本地数据目录。六、实战在 OpenCompass 中评测 SeedBench6.1 查看可用配置使用 tools/list_configs.py 过滤 SeedBench 相关数据集配置python tools/list_configs.py seedbench输出中第一列的abbr如seedbench_1-1_zero-shot即可作为--datasets参数。6.2 命令行方式评测OpenCompass 支持直接通过命令行指定 HuggingFace 模型进行评测参照 docs/zh_cn/get_started/quick_start.md 的命令行用法python run.py \ --datasets seedbench_1-1_zero-shot seedbench_1-2_zero-shot seedbench_2-1_zero-shot \ --hf-type chat \ --hf-path 你的模型路径或ID \ --debug6.3 配置文件方式评测更推荐的做法是编写评测配置文件通过read_base继承 SeedBench 数据集配置与目标模型配置参照 quick_start 中的配置文件示例 examples/eval_chat_demo.py 的组织方式from mmengine.config import read_base with read_base(): from .datasets.SeedBench.seedbench_gen import seedbench_datasets from .models.hf_internlm.hf_internlm2_chat_1_8b import models as internlm_chat_models datasets seedbench_datasets # 22 个 zero-shot / one-shot 子任务 models internlm_chat_models然后运行python run.py 你的评测配置文件路径 --debug6.4 结果输出评测完成后OpenCompass 会将各子任务seedbench_1-1_zero-shot、seedbench_1-1_one-shot等的 Accuracy / Macro-F1 / ROUGE-L / ACCStrScore 汇总为表格输出 CSV 与 TXT 结果文件便于对照 README 中发布的基准成绩进行复现。七、关键基准结果README 记录了作者团队对 26 个 LLM涵盖闭源、开源与领域专用模型的评测结果以下为文档中的代表性数据7.1 按任务类型Question Type的得分ModelQA-1QA-2QA-3QA-4SUM-1SUM-2RC-1RC-2RC-3RC-4RC-5AvgGPT-460.5073.8721.3536.0758.7362.89100.0096.4487.8662.2986.7467.88DeepSeek-V372.5079.8429.2940.6348.0654.67100.0097.2287.8955.1986.7468.37Qwen2-72B59.5075.9819.5531.6231.0863.0999.1294.2472.2051.5889.9662.54整体表现最佳的两个模型为DeepSeek-V368.37与GPT-467.88。值得关注的是几乎所有模型的填空QA-3 / RC-3与生成QA-4 / RC-4类任务得分都显著低于选择类任务说明开放生成式作答仍是领域大模型的主要短板。7.2 按子类别Subcategory的得分ModelC1C2C3C4C5C6C7C8C9C10AvgGPT-459.5960.5576.3261.1656.3459.3563.6764.7460.6567.6662.06DeepSeek-V3-671B56.0362.4274.8163.1755.2358.8468.2369.0466.4668.4863.30Qwen2-72B51.1658.1074.0759.7251.5857.7658.8561.6356.6959.1157.62按子类别统计最优模型为DeepSeek-V3-671B63.30与GPT-462.06。八、总结与使用建议领域聚焦SeedBench 是首个面向种子科学育种场景的多任务基准三大育种环节、11 种任务类型、中英双语、水稻先行是评估 LLM 垂直领域能力的代表性数据源工程接入完善OpenCompass 已提供开箱即用的配置opencompass/configs/datasets/SeedBench/与完整实现opencompass/datasets/SeedBench.py支持 Hugging Face / ModelScope / 本地三种数据来源zero-shot 与 one-shot 双设置共 22 个子任务指标层次分明单选与子类分类用 Accuracy多选用 Macro-F1填空、摘要、生成与信息抽取用 ROUGE-L中文场景结合 jieba 分词评测口径清晰可复现复现建议使用python tools/list_configs.py seedbench确认可用abbr再通过命令行或配置文件方式运行python run.py并将结果与 README 中的基线DeepSeek-V3 / GPT-4 / Qwen2-72B对比即可快速定位模型在种子科学领域的能力短板。赞分享模型评测人工智能大模型AI 评测【免费下载链接】opencompassOpenCompass is an LLM evaluation platform, supporting a wide range of models from OpenAI, Anthropic, Gemini, Qwen, GLM, DeepSeek, etc, across 100 datasets covering knowledge, reasoning, coding, science, language, long-context, and safety.项目地址https://gitcode.com/gh_mirrors/op/opencompass点击查看免费下载相关推荐Genkit Express Plugin 实战指南将 Genkit Flow 与 Action 快速暴露为 Express REST APIGenkit Express Plugin 实战指南将 Genkit Flow 与 Action 快速暴露为 Express REST API Genkit模型评测人工智能大模型AI 评测lm-evaluation-harness 中的 EgyMMLU 评测任务面向埃及阿拉伯语的多选题基准接入与使用指南lm evaluation harness 中的 EgyMMLU 评测任务面向埃及阿拉伯语的多选题基准接入与使用指南 EgyMMLU 是 lm evaluat人工智能模型评测AI 评测Delta模拟器金手指使用指南代码格式、不生效排查与自定义实操Delta模拟器金手指使用指南代码格式、不生效排查与自定义实操 Delta 是一款非越狱 iOS 经典游戏模拟器内置金手指功能。本文讲清金手指的工作原理给游戏开发上一篇零延迟的 macOS 音频回环驱动 BlackHole从安装到跑通只需 10 分钟下一篇Loop3 分钟上手的免费 macOS 窗口管理与分屏工具创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考