論文の要点と背景
LABBench2は生物学研究タスクを現実世界レベルで評価するAIベンチマークで、LAB-Benchからの進化点を示す。総タスク約1,900、公開データと評価ハーネスを提供し、研究の再現性と比較可能性を高める。用語として LAB-Bench / LABBench2 / LitQA2 / DbQA などのカテゴリを定義し、モデル間の差異の大きさと難易度の上昇、実務適用の拡大を要点として提示する。
背景技術と先行研究
背景技術と先行研究では、科学研究をAIで支援するベンチマークの歴史を概観する。従来のベンチマークはタスクの狭さと再現性不足に悩み、現場の実務適用には限界があった。そこで、LAB-Benchの位置づけを踏まえ、LABBench2は多様なタスクと公開ハーネスで現実世界の研究作業能力を測定する設計を採用している。データパイプラインの透明性、評価指標の標準化、CANARY文字列による再現性確保が実務適用の鍵となる。
LABBench2の提案内容
LABBench2は約1,900タスクを通じ、現実世界の科学作業能力の測定と学習済みモデルの一般化能力の評価