趋势

244 条趋势 · 第 17 / 21 页
周 · 2026-W16 · Software Intelligence

编程代理研究现在取决于可执行证明和控制层

本周的编程代理研究里,最扎实的部分是那些最终落到可检查产物上的论断。重点集中在可执行证明、以仓库为依据的推理,以及围绕搜索、工具和评估的显式控制层。和本地历史中的前两周相比,这份简报更具体地说明了这些控制是怎样在工作流内部实现的,而不只是解释它们为什么重要。

周 · 2026-W16 · Embodied AI

机器人论文收紧评测,并让控制状态更显式

本周机器人论文最突出的点很明确:具身智能论文正在用更严格的评测和更显式的内部结构收紧动作闭环。LongBench、HazardArena 和 HiVLA 很好地体现了这一重点。这些论文更认可这样一类系统:它们在执行过程中显式暴露规划状态、记忆、风险和与任务相关的信号,然后再用具体动作失败和长时程行为来检验这些设计。

日 · 2026-04-19 · Software Intelligence

编码研究正在收紧对代理实际完成内容的检查

4 月 19 日的编码研究,最强的地方在于系统不再相信表面成功。PDB、Prometheus 和 Terminal Wrench 各自加了一层更严格的检查:编辑是否精确,补丁是否符合已验证的需求,代理是否在不欺骗验证器的情况下完成任务。实际信息很清楚。更好的编码代理现在同样依赖评估层和控制层,而不只是依赖原始生成质量。

日 · 2026-04-19 · Embodied AI

机器人研究更明确地讨论记忆与机制

这一天的论文数量不多,但信号很清楚:机器人论文正在把内部状态和物理约束讲得更明白。Dual-Anchoring 通过在 Video-LLM 内部监督进度和地标记忆,提升了长时程导航。MM-Hand 在硬件上做了同样的事,量化远程腱路由带来的力和延迟代价,同时保持机械手更轻、更模块化,也更容易加传感器。

日 · 2026-04-18 · Software Intelligence

编码研究正在把代理和评估周围的控制层说得更具体

4 月 18 日的研究最强的地方,是编码系统更容易运行、审计和信任。当天的重点是代理的运维控制、对评估偏差的直接测试,以及面向仓库的工具,用来为 AI 工作准备代码库。HiveMind、LLM judge 审计和 Workstream 把主要模式都抓住了:当论文把模型外面的控制层说清楚,结果就会更好。

日 · 2026-04-18 · Embodied AI

机器人工作聚焦于真实世界长时程评测

这个时期规模不大,但方向一致:最强的信号是机器人研究在真实世界长时程评测上变得更具体。LongBench 为操作任务加入了机制层面的基准,而一篇同期的机器人学习历史回顾把这个需求和更大的数据采集、部署周期联系起来。结果是,大家更明确地关注在真实场景里测量执行漂移、时序失败和上下文使用。

日 · 2026-04-17 · Software Intelligence

编码进展来自更严格的中间检查

这一天最清楚的信号是,编码研究正在把生成、检索或自主行动之前的检查收紧。LogicLoc、REA-Coder 和 Zoro 都加了具体的控制点:对代码事实做结构化查询、做需求对齐循环、以及把规则执行绑定到计划步骤。共同重点很简单。更好的编码结果来自更强的中间证据,而不只是更强的基础模型。

日 · 2026-04-17 · Embodied AI

机器人学习论文正在把可靠性和任务结构写得更明确

这一天的内容最强的一点很明确:机器人学习论文正在把对可靠性、记忆和结构的控制写得更具体。ReconVLA 和 AEGIS 把失效和遗忘当作首要工程问题。ChemBot 为长任务加入记忆和进度跟踪。那篇世界模型综述也用按功能拆分的方式强化了同样的判断,而不是继续用一个宽泛的模型标签来概括能力。

日 · 2026-04-16 · Software Intelligence

编码代理的进展来自更严格地控制轨迹、成本和环境

这个时期的重点是编码代理通过压缩证据、尽早剪掉薄弱轨迹、并在更难环境里自测来提升。最强的论文是 Scaling Test-Time Compute for Agentic Coding、LinuxArena 和 Argus。放在一起看,它们给出一个直接判断:进展来自更严格地控制代理保留什么、复用什么、以及允许它做什么,并且已经在 SWE 任务、运维基准和底层 kernel 工作上看到具体收益。

日 · 2026-04-15 · Software Intelligence

编码代理的进步来自更紧的反馈循环和更严格的证据

这一时期最清楚的信号是,编码研究正在围绕证据、上下文和反馈收紧控制回路。CollabCoder、仓库压缩研究,以及 SAP HANA 测试生成论文都显示出同一条实用规则:更好的结果来自更有选择性的引导和更严格的检查,而不是让代理在没有约束的情况下跑更久。最强的论文用通过率、延迟或 mutation score 的具体提升支撑了这个判断。