趋势

244 条趋势 · 第 3 / 21 页
日 · 2026-07-11 · Software Intelligence

代理可靠性取决于上下文处理和可验证的交接

最有说服力的工作把上下文处理当作工程控制。qMLX 在一台 Mac Studio 上减少了长上下文的重复预填充,ContextOps 则在推理前检查输入载荷的结构。AgentTransfer 将同样的操作纪律用于文件交换。现有证据支持可检查的组件,但多个项目仍缺少独立基准测试。

日 · 2026-07-10 · Software Intelligence

当规范变得可执行且可复用时,编码代理的表现会提升

当天最有价值的工作将大语言模型(LLM)编码作为受控的工程流程。ReProAgent和TestAgent把仓库上下文与运行时反馈连接起来,DualVeri则将机器检查的证明与针对实际实现的测试结合起来。可复用的任务上下文也成为降低成本、提高完成率的实际手段。

日 · 2026-07-09 · Embodied AI

机器人策略的提升取决于记忆、定向适应和更高难度的灵巧操作测试

这一时期的机器人学习工作集中于提高现有策略在扰动和稀疏反馈下的可靠性。Harness VLA 在冻结控制器外加入规划和重试。Prompt-Driven Exploration 搜索由语言条件控制的行为。DexVerse 说明这些控制为何重要:领先方法在其测试的灵巧操作任务上平均成功率只有 34%。

日 · 2026-07-09 · Software Intelligence

可执行 harness 已开始决定 agent 的成本、可靠性和测试时增益

Agent 的性能越来越取决于模型周围的可执行控制层。TTHE 通过根据无标签轨迹编辑 harness 来改进固定的大语言模型(LLM),Long-Horizon-Terminal-Bench 则显示了当前 agent 在持续终端工作中的性能会多快下降。仓库级检查补足了这一点:实用的 agent 需要自适应控制、密集评估和结构验证。

日 · 2026-07-07 · Embodied AI

机器人策略研究正集中于几何结构、生成式示范和控制延迟

当天的机器人论文将物理细节纳入策略流程。视觉语言动作(VLA)模型加入 3D 结构、可复用示范、缓存动作块和明确的交接检查。RynnWorld-4D、RynnWorld-Teleop 和 Lift3D-VLA 的重点最清晰:让机器人控制更快、更具空间依据,同时减少对原始物理数据采集的依赖。

日 · 2026-07-07 · Software Intelligence

代码代理需要验证器、审查器和基于轨迹的修复

当天的研究将代码代理视为需要在工作过程中接受外部检查的系统。Aria 展示了大规模的验证器门控证明搜索;SWE-Review 加入了面向代码库的审查;TraceProbe 衡量一次运行如何搜索、编辑和验证。当前重点是工作流中的可靠性证据,最终任务分数只是多个信号之一。

周 · 2026-W27 · Software Intelligence

编码智能体正按审查负担、运行成本和隔离能力接受评判

本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。