代理可靠性取决于上下文处理和可验证的交接
最有说服力的工作把上下文处理当作工程控制。qMLX 在一台 Mac Studio 上减少了长上下文的重复预填充,ContextOps 则在推理前检查输入载荷的结构。AgentTransfer 将同样的操作纪律用于文件交换。现有证据支持可检查的组件,但多个项目仍缺少独立基准测试。
最有说服力的工作把上下文处理当作工程控制。qMLX 在一台 Mac Studio 上减少了长上下文的重复预填充,ContextOps 则在推理前检查输入载荷的结构。AgentTransfer 将同样的操作纪律用于文件交换。现有证据支持可检查的组件,但多个项目仍缺少独立基准测试。
机器人学习正在处理现有策略流程中的实际瓶颈。失败的执行轨迹被转化为监督信号,潜在动作会去除视觉混杂因素,动作轨迹也加入了明确的速度和力控制。最明显的结果体现在样本效率、可控性和真实环境执行上。
当天最有价值的工作将大语言模型(LLM)编码作为受控的工程流程。ReProAgent和TestAgent把仓库上下文与运行时反馈连接起来,DualVeri则将机器检查的证明与针对实际实现的测试结合起来。可复用的任务上下文也成为降低成本、提高完成率的实际手段。
这一时期的机器人学习工作集中于提高现有策略在扰动和稀疏反馈下的可靠性。Harness VLA 在冻结控制器外加入规划和重试。Prompt-Driven Exploration 搜索由语言条件控制的行为。DexVerse 说明这些控制为何重要:领先方法在其测试的灵巧操作任务上平均成功率只有 34%。
Agent 的性能越来越取决于模型周围的可执行控制层。TTHE 通过根据无标签轨迹编辑 harness 来改进固定的大语言模型(LLM),Long-Horizon-Terminal-Bench 则显示了当前 agent 在持续终端工作中的性能会多快下降。仓库级检查补足了这一点:实用的 agent 需要自适应控制、密集评估和结构验证。
当天的证据集中在实际问题上:编码代理需要更安全的执行边界、更好的任务输入,以及成本更低的重复执行能力。Claude Code、Codex 和 SpellSmith 提供了安全方面的主要案例;生产实践和基准测试论文给出了具体指标。
当天的机器人论文将物理细节纳入策略流程。视觉语言动作(VLA)模型加入 3D 结构、可复用示范、缓存动作块和明确的交接检查。RynnWorld-4D、RynnWorld-Teleop 和 Lift3D-VLA 的重点最清晰:让机器人控制更快、更具空间依据,同时减少对原始物理数据采集的依赖。
当天的研究将代码代理视为需要在工作过程中接受外部检查的系统。Aria 展示了大规模的验证器门控证明搜索;SWE-Review 加入了面向代码库的审查;TraceProbe 衡量一次运行如何搜索、编辑和验证。当前重点是工作流中的可靠性证据,最终任务分数只是多个信号之一。
当天的研究主要集中在机器人操作,并让策略内部状态更加明确:未来状态、潜在动作、相机位姿和子任务记忆。InternVLA-A1.5、Cortex 和 CamVLA体现了当前重点:保持语言条件控制的速度,同时加入长时程、复杂任务所需的物理或时间信号。
当天最有力的证据把编码代理视为在真实工作流中训练、行动并失败的仓库参与者。KAT-Coder-V2.5、EvoAgentBench 和 EdgeBench 重视可执行环境、长时间运行和可复用程序;GitHub 研究则补充了维护者面临的成本。
本周机器人研究把视觉-语言-动作(VLA)策略放进真实执行约束中。最有力的证据来自能够预测动作相关变化、管理长 rollout,并让服务延迟与任务进度保持关联的模型。Bridge-WA、FurnitureVLA 和 ROSA 显示了最清楚的压力点。
本周的证据把编码智能体视为生产系统。最有力的工作衡量了智能体离开单任务演示后的审查负担、token 支出和权限控制。SWE-INTERACT 让顶尖模型的解决率降到单轮结果的大约一半,TraceLab 显示长上下文读取主导服务成本,Securing Agentic Identity 则让可复用 OAuth token 留在智能体运行时之外。