趋势

244 条趋势 · 第 15 / 21 页
周 · 2026-W17 · Software Intelligence

Coding-agent 研究正在按可运行证明、代码仓库真实性和 harness 质量来评判

本周的 coding-agent 研究里,最有说服力的结论都落在可运行证据上。基准和系统持续追问的是:代码能否构建、执行,并通过工作流检查。同一批材料也反复显示出两个限制:仓库规模任务依然经常失败,而 harness 的选择对结果的影响可以和模型本身一样大。

周 · 2026-W17 · Cross Platform

Kotlin Multiplatform 以一个具体但带宣传性质的移动代码共享案例支撑了本周

本周有一个可以发布的研究信号,但范围较窄:Kotlin Multiplatform 被作为一种降低移动交付成本、让 iOS 和 Android 保持同步的实用途径来推广。证据来自一篇与 JetBrains 有关的案例文章,因此它适合作为采用论证,而不是严格的基准评测。与前一周覆盖范围更广的框架和工具更新相比,这一周的内容更具体,但只建立在单一来源之上。

周 · 2026-W17 · Embodied AI

本周机器人研究聚焦于能够恢复、适应并保持贴近真实执行的控制

本周的机器人研究集中在真实任务压力下的执行质量。最强的一批论文把控制状态显式化,在接触时刻加入物理反馈,并用以动作为基础的评估来判断进展。与最近几周相比,这份简报对部署条件写得更具体:恢复、干预、安全和小数据适应都被当作核心方法选择,而不是附带分析。

日 · 2026-04-26 · Software Intelligence

可执行证据正在为编码和代理研究定节奏

这一时期最强的工作收紧了生成与可执行证据之间的联系。KISS Sorcar、AgentEval 和 ClawMark 都按系统能完成什么、能追踪什么、能在真实工作流中承受什么来评分。SeGa 和 Optimas 把同样的思路扩展到基于需求的测试和基于性能分析器的优化,并在真实漏洞和测得的加速上取得了具体收益。

日 · 2026-04-26 · Embodied AI

接触时刻控制与 VLA 安全定义了这一天的机器人论文

这一天最强的是必须在接触时刻起作用的具身控制。两篇论文都在改进操作执行:Move-Then-Operate 把接近阶段和接触阶段分开,Tube Diffusion Policy 在动作时间范围内加入逐步的视觉-触觉修正。第三篇论文用一篇关于视觉-语言-动作,也就是 VLA 系统的安全风险和防御的综述,把视角扩大到部署问题,说明部署已经成为核心研究议题的一部分。

日 · 2026-04-25 · Software Intelligence

可执行证据正在抬高编码和代理研究的门槛

4 月 25 日的编码研究,最强的地方在于主张能碰到可执行证据。Simulating and Evaluating Agentic Systems 和 CUJBench 都坚持用完整运行、工具轨迹、状态变化和可复现产物来评判代理。仓库工作仍然很难:RAT 改善了配置,但真实提交研究还是显示生成之后会出现编译、分析和测试失败。