趋势

244 条趋势 · 第 2 / 21 页
日 · 2026-07-17 · Software Intelligence

验证正聚焦于真正重要的代码路径

近期证据使操作性验证更加精准。DiffTestGen 针对发生变更的行为,而 GapForge 针对未覆盖的编译器区域;两者的表现都优于覆盖范围更广的测试生成基线。治理和安全研究将同一原则延伸到了测试之外,但其中一些结论仍依赖小规模研究或不完整的报告。

日 · 2026-07-16 · Embodied AI

更长的机器人记忆与更快的预测成为实用的控制机制

近期的每日证据将预测性监督与部署效率视为并行问题。当前论文将两者联系得更紧密:只有在控制运行时成本的前提下,更长的历史、预期运动和模拟结果才能改善控制。真实机器人和基准测试中的结果颇具潜力,但大多数结果仍局限于单独的任务套件和内部报告的评估。

日 · 2026-07-16 · Software Intelligence

可执行门控揭示静态代理评分遗漏的失败

近期围绕工程化检查的进展正变得更加面向实际操作。当前证据支持将控制措施绑定到实际源状态、工具版本和领域规则。静态或纯文本的成功表现可能掩盖供应链、工作流和适应性方面的失败。这些研究大多范围较窄或处于早期阶段,因此确立的是具体的失败模式,而不是广泛的生产可靠性。

日 · 2026-07-15 · Embodied AI

机器人策略保留预训练知识,并将恢复任务交给轻量级控制层

今天的证据进一步支持近期对部署的关注,并指向一种更具体的设计模式:保留有用结构,而不是端到端地重新学习所有内容。两项研究在视觉—语言—动作(VLA)微调期间保护预训练语义,另一些研究则将预测训练、运行时恢复和人工纠正与已部署的动作策略分离。结果令人鼓舞,但大多仍局限于单项基准测试和小规模真实机器人研究。

日 · 2026-07-15 · Software Intelligence

工具编排选择会改变智能体得分、工具习惯和安全结果

近期关于工程化上下文和可执行检查的证据,正在工具编排框架层面变得更加具体。今天的研究表明,交互协议会改变基准得分,持久会话可能使智能体固守过时的工具使用流程,而有针对性的探索可以改善安全分析。部署仍不成熟:观察到的编码智能体使用并不普遍,而且通常由一个人监督。

日 · 2026-07-14 · Embodied AI

VLA 部署工作同时针对延迟、连续性和稀缺交互数据

当天的证据将近期对高效机器人学习的关注延伸到了部署环节。视觉-语言-动作(VLA)系统正在围绕推理、控制连续性和数据采集进行优化,而不只是依靠模型规模扩展。现有结果涵盖仿真和有限的真实机器人测试,因此其在广泛实际环境中的可靠性仍未得到证明。

日 · 2026-07-14 · Software Intelligence

结构化上下文降低智能体成本,但更快的审查仍伴随质量风险

证据进一步支持近期的发现:编码智能体的收益取决于经过设计的上下文和可执行检查。新研究报告了更低的 token 使用量、更窄的搜索范围,以及更好的修复或规范生成结果。然而,一项大规模观察性审查研究将更快的智能体辅助决策与更多质量异味联系起来。大多数结果仍局限于特定基准或组织,因此它们支持对工作流的设计选择,而不是对已部署智能体作出广泛判断。

日 · 2026-07-13 · Embodied AI

机器人学习通过预测后果和对齐控制坐标获得提升

上一個有数据的日窗口强调了对稀缺动作信号的高效利用。今天的论文延续了这一关注点,并进一步强调预测性监督和显式几何。生成的未来场景、无动作标签视频以及坐标对齐的输入都带来了可测量的策略增益。VIA还表明,能力较强的通用智能体可以通过精心设计的视觉界面控制机器人,无需针对机器人进行专门微调。

日 · 2026-07-13 · Software Intelligence

编码代理的提升来自工程化上下文和可执行检查

当天最强的信号延续了近期对受控代理工作流的关注,同时测量证据更加充分。ACQUIRE 在编辑前回答代码仓库问题,从而改善问题解决。TerraRepair 根据 schema 和扫描器结果验证基础设施修复。FlowArk 复用有界且与代码匹配的知识,减少重复分析。共同机制是将精确上下文送达操作发生的时点,随后进行外部检查。

周 · 2026-W28 · Embodied AI

机器人策略的进步取决于记忆、失败经验复用和可执行的动作控制

本周的机器人学习研究集中于视觉-语言-动作(VLA)策略中的执行瓶颈。任务记忆支持重试和阶段跟踪。失败轨迹与无标注视频提供了更多有用监督。连续轨迹和考虑力的后训练提升了速度与接触安全性。DexVerse显示,这些提升仍有限:在其19项任务评估子集上,测试方法的最高平均成功率只有34%。

周 · 2026-W28 · Software Intelligence

可执行控制与验证正在决定编码智能体的上限

本周,编码智能体的进展取决于大语言模型(LLM)周围的控制层,包括可执行 harness、运行时检查和仓库工作流。TTHE 在模型权重冻结的情况下取得了较大提升,长时域评测则暴露出严重的任务完成限制。产品设计采用了类似的控制措施,但对比证据仍然有限。

日 · 2026-07-12 · Software Intelligence

代理产品正成为运营系统,但证据仍然有限

代理产品正被设计成受控的运营系统。OneDev 将编码工作固定在议题、拉取请求和持续集成(CI)中;Avriz 通过影子测试和流量上限控制学习型模型路由;Mango 将记忆和权限保存在用户设备上。实测证据并不均衡。最强的基准测试也只覆盖 10 个合成拉取请求,而大多数产品声明缺乏比较评估。