语料专业能力评估
Machine Studying 为评估智能体在下游任务公布前,能否基于未见过的文档语料做准备,提供了一个具体测试。论文提出的 StudyBench 覆盖 DSPy 代码、OpenClaw 代码和机器学习文献。它的指标奖励在较低推理 token 预算下取得更高准确率,因此需要多轮搜索循环的智能体得分较低。
早期结果偏谨慎。检索增强生成、长上下文和简单微调都不能稳定地产生可用的语料专业能力。一个例子显示,Qwen3.5-9B 在被强制使用 20 次搜索迭代时,在 DSPy 上有所提升;但更广泛的结论是,如果缺少更好的学习行为,可访问的证据仍可能没有被用上。