synthesis-bench
Overview
Leaderboard
Findings
Tasks
Methodology
Collaborate
Title/abstract screening
?
Effort:
medium
Model
?
Reward
Recall
Precision
Claude Opus 5
0.832
0.964
0.591
GPT-5.6 Sol
0.779
0.898
0.599
Claude Sonnet 5
0.752
0.891
0.565
GPT-5.6 Terra
0.730
0.837
0.667
GPT-5.6 Luna
0.640
0.774
0.602
Full-text extraction
?
Effort:
medium
Model
?
F1
Claude Opus 5
0.415
Claude Sonnet 5
0.395
GPT-5.6 Terra
0.372
GPT-5.6 Sol
0.347
GPT-5.6 Luna
0.264
Risk of Bias
?
Effort:
medium
Model
?
Cohen’s κ
GPT-5.6 Luna
0.293
GPT-5.6 Sol
0.252
Claude Sonnet 5
0.210
GPT-5.6 Terra
0.209
Claude Opus 5
0.178