[Fix] Update MedBench (#845)

35aace77 · Xiaoming Shi · GitHub · 8ed022b4 · 35aace77 · 35aace77
Unverified Commit 35aace77 authored Jan 26, 2024 by Xiaoming Shi Committed by GitHub Jan 26, 2024
Showing with 161 additions and 255 deletions

configs/datasets/MedBench/medbench_gen_0b4fff.py configs/datasets/MedBench/medbench_gen_0b4fff.py +3 -27

opencompass/datasets/medbench/medbench.py opencompass/datasets/medbench/medbench.py +158 -228

No files found.
--- a/configs/datasets/MedBench/medbench_gen_0b4fff.py
+++ b/configs/datasets/MedBench/medbench_gen_0b4fff.py
@@ -2,13 +2,13 @@ from opencompass.openicl.icl_prompt_template import PromptTemplate
 from opencompass.openicl.icl_retriever import ZeroRetriever
 from opencompass.openicl.icl_inferencer import GenInferencer
 from opencompass.openicl.icl_evaluator import AccEvaluator
-from opencompass.datasets import MedBenchDataset, MedBenchEvaluator, MedBenchEvaluator_Cloze, MedBenchEvaluator_IE, MedBenchEvaluator_mcq, MedBenchEvaluator_CMeEE, MedBenchEvaluator_CMeIE, MedBenchEvaluator_CHIP_CDEE, MedBenchEvaluator_CHIP_CDN, MedBenchEvaluator_CHIP_CTC, MedBenchEvaluator_NLG, MedBenchEvaluator_TF, MedBenchEvaluator_DBMHG, MedBenchEvaluator_SMDoc, MedBenchEvaluator_IMCS_V2_MRG
+from opencompass.datasets import MedBenchDataset, MedBenchEvaluator, MedBenchEvaluator_Cloze, MedBenchEvaluator_CMeEE, MedBenchEvaluator_CMeIE, MedBenchEvaluator_CHIP_CDEE, MedBenchEvaluator_CHIP_CDN, MedBenchEvaluator_CHIP_CTC, MedBenchEvaluator_NLG, MedBenchEvaluator_TF, MedBenchEvaluator_DBMHG, MedBenchEvaluator_SMDoc, MedBenchEvaluator_IMCS_V2_MRG
 from opencompass.utils.text_postprocessors import first_capital_postprocess
 medbench_reader_cfg = dict(
    input_columns=['problem_input'], output_column='label')
-medbench_multiple_choices_sets = ['Med-Exam', 'DDx-basic', 'DDx-advanced', 'SafetyBench'] # 选择题，用acc判断
+medbench_multiple_choices_sets = ['Med-Exam', 'DDx-basic', 'DDx-advanced', 'MedSafety'] # 选择题，用acc判断
 medbench_qa_sets = ['MedHC', 'MedMC', 'MedDG', 'MedSpeQA', 'MedTreat', 'CMB-Clin'] # 开放式QA，有标答
@@ -20,31 +20,7 @@ medbench_ie_sets = ['DBMHG', 'CMeEE', 'CMeIE', 'CHIP-CDEE', 'CHIP-CDN', 'CHIP-CT
 medbench_datasets = []
-for name in medbench_single_choice_sets:
+for name in medbench_single_choice_sets + medbench_multiple_choices_sets:
-    medbench_infer_cfg = dict(
-        prompt_template=dict(
-            type=PromptTemplate,
-            template=dict(
-                round=[dict(role="HUMAN", prompt='{problem_input}')])),
-        retriever=dict(type=ZeroRetriever
-                       ),  # retriver 不起作用，以输入参数为准 (zero-shot / few-shot)
-        inferencer=dict(type=GenInferencer))
-    medbench_eval_cfg = dict(
-        evaluator=dict(type=MedBenchEvaluator_TF), pred_role="BOT")
-    medbench_datasets.append(
-        dict(
-            type=MedBenchDataset,
-            path='./data/MedBench/' + name,
-            name=name,
-            abbr='medbench-' + name,
-            setting_name='zero-shot',
-            reader_cfg=medbench_reader_cfg,
-            infer_cfg=medbench_infer_cfg.copy(),
-            eval_cfg=medbench_eval_cfg.copy()))
-for name in medbench_multiple_choices_sets:
    medbench_infer_cfg = dict(
        prompt_template=dict(
            type=PromptTemplate,

--- a/opencompass/datasets/medbench/medbench.py
+++ b/opencompass/datasets/medbench/medbench.py