ScienceDiscovery
English GitHub

调研鸟类迁徙如何定位与导航

问题背景

候鸟能够长距离迁徙,但“朝哪个方向飞”和“现在处于哪里”是两个不同的问题。太阳、星空、地磁、气味和地标分别可能提供什么信息?不同鸟种、年龄和实验条件下,证据是否一致?光污染和其他干扰又会怎样影响导航?

本教程以 DeepResearchBench 的 DRB-59 为例,带你完成一次科学文献调研:配置检索资源、提交问题、观察研究过程,最后阅读并检查带引用的报告。不需要上传实验数据,也不涉及基因表达分析或通路富集。

原始问题来自 DeepResearchBench,仓库中的真实 E2E 保留了原题,并追加报告与产物交付要求。下面的历史结果来自实际执行记录,不是官方参考答案,也不是官方排行榜成绩。

准备工作

先完成快速开始,启动服务并打开界面。本节保留首次调研需要的配置;完整参数见运行时行为。

模型

在 系统配置 → 模型注册表 添加可用模型,填写服务商的 Base URL、模型 ID 和 API Key,然后在 Project 或 Session 中选择它。密钥只填入配置界面,不要放进任务消息。历史示例使用 DeepSeek Flash,你可以选择其他支持工具调用的模型,但耗时、成本和结果可能不同。

模型注册表

连接器与检索

在 系统配置 → Connectors 配置并检查文献检索连接器,再确认当前 Session 能使用这些连接器。PubMed 可用于相关生物学研究,bioRxiv 可补充预印本;网页搜索与可访问的期刊页面可补充生态学资料。可用来源取决于本机实际安装和配置,不要求只用某两个数据库。

检查会话覆盖设置:显式选择空连接器列表会禁用继承的连接器。网页搜索结果中的片段也不等于论文全文。若某个来源不可用,Agent 应换用可用来源,并在报告中说明覆盖缺口;不要把“未检索到”直接当成“没有相关研究”。连接器配置见配置自定义 MCP。

连接器设置

技能

在 系统配置 → Skills 检查已安装技能。literature-searcher 用于检索、去重和整理来源,不负责整个研究的协调或最终报告撰写。Project / Session 默认 all 模式允许使用全部已安装技能;若使用 selected 白名单,确认需要的技能在其中。

技能可用不代表本次一定加载。任务中可以要求使用适合的技能,实际是否使用应查看执行记录。首次实践无需自建技能;需要复用自己的检索流程时,再考虑导入或创建。

技能设置

专家与科学记忆

系统配置 → Specialists 可以将指令、模型、技能和连接器组织为可复用的专家。第一次使用默认配置即可;已有文献调研专家时,也应检查它是否限制了本次需要的工具。

科学记忆为可选项,可先关闭以减少配置。在 系统配置 → 记忆 开启时,默认的本地文件后端不需要额外服务;只有选择 Neo4j 后端时才需要配置 Neo4j。它帮助查看已记录的关系,不保证每条结论自动获得完整证据,也不替代人工核查。详见科学记忆配置。

执行环境与时间

确认沙箱可用;如果任务需要运行脚本,等待科学计算环境就绪。运行中出现代码、连接器或下载审批时,按实际操作内容处理。不要仅为消除等待而关闭所有审批。

建议为首次完整调研预留一至两小时和模型调用预算。DRB-59 的真实 E2E 默认允许研究运行两小时,这是本地测试预算,不是 DRB 官方规定,也不会自动修改普通会话的超时设置。模型无响应、工具超时与整项任务的时间上限是不同限制,具体设置见配置参考。

任务开始

新建一个 Project,例如 bird-migration-review,并创建 Session。无需上传输入文件。将下面的完整任务粘贴到消息框并发送;它与现有真实 E2E 在未设置子任务数量限制时使用的提示词一致:

Complete the following DeepResearchBench task as a scientific literature review.
The original question defines the research scope. Choose your own research strategy, delegation and search depth.
Use credible sources, synthesize the evidence, and distinguish established findings, contested claims and limitations.
Support substantive claims with inline citations linked to source URLs in the references.
Deliver the full report as a declared Markdown Artifact named deepresearchbench-59.md; mention it in your final answer.
<task>
In ecology, how do birds achieve precise location and direction navigation during migration? What cues and disturbances influence this process?
</task>

这里保留英文原题,以便与已有实验对照。日常使用可以另行要求中文报告,但这会改变提示词,应与原实验区分记录。报告可以使用 Markdown、表格等形式,不要求额外画图或凑足某个文献数量。

确定要求

阅读研究计划时,重点确认它围绕问题展开,而不是只罗列鸟类迁徙的一般知识:

要检查的方面 阅读计划时可以问的问题
定位与定向 是否区分判断位置与选择飞行方向?
导航线索 是否比较不同线索的作用、适用条件和相互关系?
干扰 是否解释干扰影响哪类线索,并提供证据?
证据边界 是否区分鸟种、野外观察、行为实验与机制假说?
综合判断 是否解释相互矛盾的研究,而不只是逐篇摘要?
交付 是否会形成可打开、带来源链接的完整报告产物?

这张表帮助你检查研究方向,不是固定答案。Agent 可能自行推进,也可能提出澄清问题;不能依赖它一定停在某个检查点。若你希望先审阅计划,日常任务中可以明确要求“开始大规模检索前等待我确认”,但这属于对原提示词的修改。

调研过程

先观察检索是否覆盖不同问题。定位、定向、线索之间的校准,以及干扰因素通常需要不同查询。一次工具调用失败不等于研究失败;重要的是后续有没有调整查询、改用来源或明确记录缺口。

如果出现子任务,可以查看它们的分工与执行记录。合理的分工可能围绕不同线索或干扰因素展开;子任务数量本身不是质量指标。主 Agent 最终需要综合证据、处理重复和矛盾,并交付一份连贯的报告。

留意是否已有可用的阶段产物。日常协作中,可以要求先保存已有结果,再修订同一产物;不要只凭聊天中的“已完成检索”判断整个任务完成。若长时间停留在同一错误或重复查询上,检查工具错误与最近产物,再决定是否收窄任务或停止运行。

最后在产物区打开 deepresearchbench-59.md,确认正文可以预览、下载,且最终回复指向它。文件写进工作区与登记为产物是两个步骤;只说“报告已写好”不足以确认交付。

结果分析

先读摘要与结论,再抽查它们对应的证据。历史报告将磁感应、天体线索、位置判断、环境干扰和证据限制分别讨论;这是一种可用的组织方式,不是每次都必须复制的目录。

选择几条关键结论,打开引用链接,检查来源的鸟种、实验条件和结论是否真正支持报告的表述。只读到摘要就不能声称核对过全文;预印本与已发表研究也应区分。若科学记忆开启,可以沿已记录的关联辅助查看,但仍需阅读来源。

下面是一组三次真实运行的历史记录。评分 Judge 使用 DeepSeek Flash,表中的研究耗时不包含独立评分:

运行 研究耗时 交付 RACE 总分(百分制展示)
第 1 次 约 55 分 33 秒 完成 56.18
第 2 次 约 22 分 20 秒 完成 55.71
第 3 次 约 28 分 34 秒 完成 不可用:当次评分出错

RACE 的 50 表示与参考报告持平,不是事实正确率 50%。 它从全面性、洞察、指令遵循和可读性评价报告。该组实验仅启用 RACE,FACT 未运行属于配置性跳过;这些数字没有证明所有引用已被核实。第 3 次不能记为零分,也不能算评分成功。

真实 E2E 的完成检查要求主任务完成,且最终回复引用至少一个可读取的非空产物。报告质量单独评分,不以字数、引用数量、子任务数量或最低分判定交付。普通界面会话不会自动运行这个独立评分器,复现实验的方法见下方测试文档。

注意事项

相关文档