主题概况

Benchmarks

第 1 / 3 页
趋势
14
想法
14
最近一期
2026-06-09
趋势 · 日 · 2026-06-09 · Software Intelligence

编码代理需要仓库级测试和上下文防护

当天最强的信号是,围绕已经在处理多文件工作的编码代理,工程纪律开始变得更重要。DeNovoSWE、EsoLang-Bench 和 DeLM 都在测试代理能否构建完整仓库、通过执行进行适应,并且不浪费调用就共享已验证进展。安全论文给出明确警告:看起来正常的上下文,也能把生成或分析出来的代码带向不安全行为。

想法 · 日 · 2026-05-05 · Embodied AI

Robot Policy Evaluation Gates

机器人团队可以把新的评测压力转成三项具体改动:为测试记忆和接触的 VLA 策略设置发布门槛、为机器人视频预测引入行为级奖励,以及为交互式世界模型比较建立共享的动作输入框架。

趋势 · 日 · 2026-04-26 · Software Intelligence

可执行证据正在为编码和代理研究定节奏

这一时期最强的工作收紧了生成与可执行证据之间的联系。KISS Sorcar、AgentEval 和 ClawMark 都按系统能完成什么、能追踪什么、能在真实工作流中承受什么来评分。SeGa 和 Optimas 把同样的思路扩展到基于需求的测试和基于性能分析器的优化,并在真实漏洞和测得的加速上取得了具体收益。

趋势 · 日 · 2026-04-25 · Software Intelligence

可执行证据正在抬高编码和代理研究的门槛

4 月 25 日的编码研究,最强的地方在于主张能碰到可执行证据。Simulating and Evaluating Agentic Systems 和 CUJBench 都坚持用完整运行、工具轨迹、状态变化和可复现产物来评判代理。仓库工作仍然很难:RAT 改善了配置,但真实提交研究还是显示生成之后会出现编译、分析和测试失败。

想法 · 日 · 2026-04-25 · Software Intelligence

可执行的编程证据

可执行证据正在成为代理评估和编程工作流的实际标准。近期最清晰的落地方向有三个:一个可回放的评估器,用真实状态和工具轨迹来检查;一个仓库接入层,在补丁生成前证明环境能跑起来;以及一个在没有测试用例时使用教师样例的科学编程流程。

趋势 · 日 · 2026-04-18 · Embodied AI

机器人工作聚焦于真实世界长时程评测

这个时期规模不大,但方向一致:最强的信号是机器人研究在真实世界长时程评测上变得更具体。LongBench 为操作任务加入了机制层面的基准,而一篇同期的机器人学习历史回顾把这个需求和更大的数据采集、部署周期联系起来。结果是,大家更明确地关注在真实场景里测量执行漂移、时序失败和上下文使用。

想法 · 日 · 2026-04-18 · Embodied AI

机器人部署复盘诊断

真实世界的长时程机器人评估已经具体到会改变日常工作流程。最直接的近期动作是按阶段的内部评测、回放后的结构化失败复盘,以及发布门槛里的动态抓取压力测试。证据里的共同点很明确:更大的机器人数据和部署循环,需要更好的方式去看清执行在时间上的断裂点,而不只是看一次运行有没有成功结束。