趋势

244 条趋势 · 第 20 / 21 页
日 · 2026-04-05 · Embodied AI

Embodied AI work is concentrating on the action loop

4 月 5 日是一个以动作控制为中心的强 embodied-AI 日。最清楚的论文改进了感知和执行之间发生的事情:更安全的 VLA 策略、自适应 action chunking,以及用于驾驶的联合视频-动作规划。共同点是操作层面的细节。作者在模块级编辑机器人策略,在推理时调整重规划,并训练世界模型,让预测场景和计划动作保持一致。

日 · 2026-04-05 · Software Intelligence

Software-agent evidence is getting tighter around control loops, compilers, and architecture checks

这一天的研究最强的部分,是那些可以用明确控制来检查的软件代理。证据最扎实的工作把模型接到编译器、工单状态、校验器门控或经过基准测试的设计工件上。这让我们更清楚地看到代理现在能做什么,以及可靠性还会在哪些地方失效,尤其是在架构理解上。

日 · 2026-04-04 · Software Intelligence

编码代理研究正在按执行循环、运行时证据和真实动作控制来评判

这一天最强的论文把编码代理的主张做得更可执行,也更可检查。重点是对代理读什么、记什么、运行什么、以及允许改什么进行具体控制。EnvGraph 和 LiveCoder 把仓库生成和运行时验证、以及多次尝试证据绑定起来。DebugHarness 把修复推进到实时调试。Squeez 和 AmPermBench 收窄了两个运维瓶颈:上下文膨胀和权限覆盖。

日 · 2026-04-03 · Software Intelligence

编码代理研究正变得更难作弊,也更容易验证

这一阶段最强的内容集中在那些要面对真实状态、真实失败模式和真实执行后果的编码代理上。SWE-STEPS 和 ABTest 让评估更具体。GrandCode 给出一个醒目的现场结果,而 IndustryCode 用更难的工业任务把上限拉回到现实。当前重点更少放在一次性补丁是否成功,更集中在代理能否在时间、工具和仓库历史中保持稳定。

日 · 2026-04-02 · Embodied AI

动作学习正在变得更精确,而 VLA 鲁棒性仍然落后

这一天最强的模式是实用的动作学习。论文通过缩短预测、动作和控制细节之间的距离,改进了机器人和驾驶系统。最明显的提升来自经过验证的世界模型、更平滑的动作分布,以及几何感知规划。与此同时,Tex3D 表明当前 VLA 模型仍然很容易被物体级视觉攻击打偏。

日 · 2026-04-02 · Software Intelligence

软件代理研究正变得更可执行、可回放,也更贴近生产

今天的研究最强的地方,是软件工作可以通过执行来检查。重点是更严格地评估编码代理,以及为代码和 API 生成更好的测试。ProdCodeBench 和 ToolMisuseBench 都缩小了基准分数与部署条件之间的差距。结果是,我们更清楚地看到代理在哪些地方还能用,在哪些地方仍然会失效。

日 · 2026-04-01 · Software Intelligence

软件代理研究对信号、证据和风险的要求更严了

这段时间最强的主题,是对软件代理的控制更紧了:训练用更干净的轨迹,评估用更好的日志,现实仓库和真实工作区里的代理行为也接受更难的测试。证据比标题党更务实。STITCH 说明更少但更有价值的轨迹能带来很大收益,而 GitHub 规模研究和安全研究把长期代码 churn 和 prompt injection 风险放到前台。

日 · 2026-04-01 · Embodied AI

控制工作越来越明确地处理接触、安全区域和 rollout 风险

这个时间段很小,但脉络一致:控制类论文把感知和动作连到错误会变成物理后果的那个点上。最强的证据来自机器人和手术场景,模型通过暴露接触状态或安全交互区域来增加价值。世界模型综述补了第二层意思:一旦预测进入规划,安全评估就必须跟踪错误在多次 rollout 中如何持续。