主题概况

Benchmarking

趋势
4
想法
4
最近一期
2026-06-30
想法 · 日 · 2026-06-30 · Software Intelligence

可审计的代码变更自动化

当编码智能体围绕审查者已经信任的工件工作时,采用路径最具体:特性到代码映射、profiler 跟踪、编译器诊断、可复现的计时运行和分阶段审批记录。最适合先尝试的是维护和性能工作流,因为团队可以在不改变整个开发流程的情况下衡量定位质量、补丁接受率、构建成功率或计时改进。

趋势 · 日 · 2026-06-18 · Software Intelligence

编码代理需要经过失败测试的指导和带关卡的执行

这一时期的编码代理工作由运行证据来判断:用失败来测试仓库指令,用基线测试为拉取请求设关卡,以及用基准暴露语言和项目规模上的差距。Probe-and-Refine、Phoenix 和 Multi-LCB 定下了基调:有用的自动化需要一个执行环境来记录尝试过什么,以及失败发生在哪里。

想法 · 日 · 2026-06-18 · Software Intelligence

编码代理发布控制

仓库维护者现在可以把代理指令、拉取请求创建和模型选择当作可测试的软件工作来处理。实际做法包括:在失败探针后修订的紧凑仓库指导、由基线对照测试和权限门禁阻断的 issue 代理拉取请求,以及覆盖生产所用语言和项目规模的评估套件。

趋势 · 日 · 2026-03-30 · Embodied AI

机器人学习工作对运行时瓶颈和脆弱评测越来越认真

这一天的机器人论文都很务实。最强的工作同时收紧了 VLA 的执行和评测。FocusVLA 和 StreamingVLA 报告了操作质量和控制速度的提升,而 LIBERO-Para 和 ManipArena 在把措辞和真实世界设置变严格之后,让现有模型显得没那么成熟。关于世界模型、仿真和触觉遥操作的支撑性论文传达了同样的信息:更好的机器人性能依赖于从训练数据到运行时控制,全程保留与任务相关的信号。

想法 · 日 · 2026-03-30 · Embodied AI

部署可靠性基准

机器人学习工作正在更接近部署里真正会出问题的地方:控制器时序、指令鲁棒性和物理评测。最近最明确的变化是一个测量停顿间隙的异步 VLA 运行时、一个给指令跟随策略用的改写测试门槛,以及一个固定机器人本体和任务条件的共享真实世界评测流程。