趋势

244 条趋势 · 第 19 / 21 页
日 · 2026-04-11 · Software Intelligence

编码代理研究正在把结构和外部检查变成主要控制面

这一天的研究表明,编码代理在控制被写下来并在模型外检查时会更好。最清楚的证据来自形式化规格、架构描述文件、harness 管理的内存和预算化评估。还有一个应用系统结果也很突出:LLM 引导的查询计划编辑在 Apache DataFusion 中带来了可测量的速度和内存收益。

日 · 2026-04-10 · Embodied AI

机器人论文要求经过验证的落地对齐和可执行数据

4 月 10 日是机器人主题的一天,标准很清楚:系统需要验证自己正在作用的对象,数据集需要产出真正能回放的动作。ProGAL-VLA、RoboLab 和 VAG 定下了基调。最强的论文要么直接暴露脆弱的落地对齐,要么围绕规划、合成和评测建立更紧的闭环,让失败在部署前就显现出来。

日 · 2026-04-09 · Software Intelligence

编码研究正在围绕测试、运行时可见性和精确定位收紧

这一天最清楚的模式,是对编码系统的控制更紧了。论文更多依赖测试、运行时仪表和更窄的定位方式,让输出更容易打分和检查。ZeroCoder 给出了最强的量化结果,而安全和代理论文一直在追问同一个实际问题:模型应该看到哪些证据,人又该怎样验证它实际用了什么?

日 · 2026-04-08 · Embodied AI

具身控制工作集中在有约束的决策机制上

这一天的内容不多,但很清楚。两篇论文都在处理更贴近现实约束的具身决策循环。一篇用事件编码情境上的记忆检索来做 UAV 控制。另一篇用有约束的想象来减少模型式强化学习里的 rollout 漂移。它们共同强调的是,在时间跨度变长或环境更复杂时,动作选择仍然要快、可检查、稳定。

日 · 2026-04-07 · Software Intelligence

软件代理研究正在收紧接口、指标和安全检查

这一天最强的工作,是让软件代理更容易被约束、检查和评分。CodeStruct 和 SWE-Shield 把代码代理评估收紧到精确编辑和设计规则。Gym-Anything 把计算机使用测试扩展到更长的真实软件任务。安全论文给出了最难反驳的证据:生成代码常常可利用,自主攻击系统在复杂的多步设置里仍会失败。

日 · 2026-04-06 · Embodied AI

机器人动作系统正在围绕可复用的控制基础设施构建

4 月 6 日最强的内容是具身控制方法,它们让机器人动作系统更容易构建、更容易调控,也更不容易失效。最清楚的证据来自 Veo-Act、StarVLA 和 E-VLA:视频预测被用于高层规划,VLA 代码库正在标准化,事件感知正在改善低光和模糊条件下的操控。当天也有评测工具和更快的机器人强化学习工作,但最扎实的主题是围绕动作的实用控制基础设施。

日 · 2026-04-06 · Software Intelligence

软件代理研究正在收敛到可验证的训练循环和硬控制闸门

这一天最清楚的工作,是让软件代理更容易评分、更容易重跑,也更容易在检查失败时被拦住。Atomic-skill RL、Agent-CoEvo 和 Nidus 分别在训练目标、仓库修复和工程治理三个位置收紧控制环。和前几天相比,重点更少放在证明代理能在真实环境中行动,更多放在建立训练和验证设置,让这些动作可以被测量。