智能体工作正被完整循环、可见故障和可审计证据所评估
当天最强的信号是,在真实约束下对智能体工作的实际测量。MAC 和 TeleSWEBench 显示,智能体在设计另一个智能体和修复领域代码方面的自主性都有限。其余论文集中在让智能体输入、工具和运行时证据可审计。
当天最强的信号是,在真实约束下对智能体工作的实际测量。MAC 和 TeleSWEBench 显示,智能体在设计另一个智能体和修复领域代码方面的自主性都有限。其余论文集中在让智能体输入、工具和运行时证据可审计。
当天的机器人论文都在处理同一个问题:如何让 Vision-Language-Action(VLA)策略在真实部署条件下稳定执行。ERVLA、GeoAlign 和 TTT-VLA 显示出最清楚的一条线索:表现取决于与机器人状态、几何和任务阶段对齐的动作相关信号。
这一时期把大语言模型(LLM)代理当作可训练、可检查的软件系统。EvoTrainer、FLARE 和 SPOQ 的证据最强:更好的代理来自诊断、带门控的执行和任务结构,人类判断出现在规划和验证环节。
这一时期的机器人工作主要围绕 Vision-Language-Action(VLA)策略展开。最强的模式是对控制的现实压力:AHEAD 预测移动物体的未来视觉 token,Dex-BEV 加入三维对齐,RoboSemanticBench 则显示,抓取能力可能掩盖语义选择薄弱的问题。
当天最强的证据把大型语言模型(LLM)代理当作需要受管权限、诊断和复核路径的系统。Agent Operating Systems、Type-Error Ablation 和 Monitoring Agentic Systems 给出的信号最清楚:可靠性取决于执行控制和反馈质量,也取决于模型输出本身。
本周机器人研究用真实执行来评估视觉-语言-动作(VLA)策略:在线微调速度、任务保持、接触质量和跨具身覆盖。EXPO-FT、OASIS 和 Qwen-VLA 支撑了证据最足的主张,多数证据来自真实机器人或操作基准。
本周的编码代理工作给出了一个实用门槛:在输出获得信任之前,代理需要仓库上下文、可执行证据、限定范围的权限,以及持久的工作流状态。RepoMirage、RADAR 和 SNARE 显示了压力点:多文件推理、生产评审和权限越界。
当天的证据更支持对大语言模型(LLM)编码工作的实际控制。agent-stack 给出了最具体的 token 节省说法。BotCircuits 把工作流路由放在模型之外。Martin Fowler 的文章则说明,代码质量仍然依赖共享概念和测试。
当天最清楚的信号是 agent 基础设施。Autonomy Kernel、Lite-Harness 和 HermesBench 都把 agents 当成长期运行的系统,认为它们需要权限检查、持久状态、审批和可追踪评估。证据主要是设计提案和早期工具,受控测量很少。
这一时期最清晰的信号是在约束下产品化:当编码代理的工作有状态、测试和廉价工具访问时,它们就有用;当平台无法吸收法律、审查或维护成本时,它们就有风险。Flathub、MCP 和 MLSys 提供了最强的证据。
当天的研究集中在可部署的机器人控制上。视觉-语言-动作(VLA)模型获得了更大的任务覆盖、更快的推理路径、更丰富的空间落地,以及更多真实机器人检查。Qwen-VLA 的统一化主张最广,BORA 给出了最清楚的灵巧适应结果,PhAIL 则质疑真实机器人成功率该如何衡量。
当天最强的信号是 AI 编码系统的操作性证据。论文在真实会话中测量代理如何失败,在生产中限制低风险审查,并用规格或领域不变量测试生成代码。RADAR、TRAILS 和 Agora 把重点放在同一件事上:只发布能够被检查、约束或复现的内容。