Google 研究团队发布 VeriHarness,用生成候选结果的同一模型执行验证:对分歧主张核查环境证据,对共识主张主动挑战,并据此选择、修订或重建最终结果。
项目在 5 个长程任务基准、2 个模型上取得最高选择分;证据驱动修订后,较单次生成平均提升 Gemini 3.5 Flash 6.2 分、Claude Opus 4.8 6.4 分,并公开约 2.6 万条 rollouts。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END

Google 研究团队发布 VeriHarness,用生成候选结果的同一模型执行验证:对分歧主张核查环境证据,对共识主张主动挑战,并据此选择、修订或重建最终结果。
项目在 5 个长程任务基准、2 个模型上取得最高选择分;证据驱动修订后,较单次生成平均提升 Gemini 3.5 Flash 6.2 分、Claude Opus 4.8 6.4 分,并公开约 2.6 万条 rollouts。
暂无评论内容