最近内容
实时2026/9/3
GitHub 最近分享了他们如何降低 GitHub Copilot 智能体的运行成本。Erik Kristensen 和 Napalys Klicius 在实践中发现,单次工具调用输出更短,并不代表整个任务更省钱。如果压缩掉的信息恰好是模型后面需要的,它就可能重新读取结果、再次执行命令,反而增加调用次数、Token 和耗时。GitHub 在测试 RTK(Rust Token Killer)时就观察到了这种情况,因此他们把评估对象从单次调用改成了完整任务。随后,团队开始更有选择地处理工具输出。cat、git diff、git show 等源码类或难以预判用途的内容保持原样;grep 等搜索结果可以重新组织,但不删除匹配项;安装、构建、
2026/9/3
Anthropic 最近总结了过去一年参与零售、电商平台、旅行、娱乐和电信等行业商业智能体项目的经验。这些系统已经进入生产环境,一些企业观察到客单规模提升、商家运营效率改善。它们采用的架构却并不复杂:一个主模型运行在标准智能体循环中,再配合技能、工具和完整的评测体系。在架构上,Anthropic 更倾向于“单智能体 + Skills”,而不是按搜索、退货、库存等领域拆成大量子智能体。商业对话往往跨越多个意图,购物车、用户偏好和历史信息需要持续共享。频繁切换子智能体容易损失上下文,还会增加 token 消耗和延迟。Skills 可以把领域指令按需加载到同一个智能体中,既保留模块化能力,又避免反复交接。只有深度研究等相对独立、需要专门上
2026/9/3
Cursor 推出 Self-Hosted Machines:让云端智能体跑在企业自己的机器上Cursor 在 9 月 2 日介绍了 Self-Hosted Machines 的最新能力:Cloud Agents 现在可以运行在企业自己管理的机器和网络环境中,并通过动态调度的机器池按需求扩缩容。Cursor 表示,目前 Cloud Agents 已经完成公司内部超过 60% 的合并 Pull Request,随着智能体承担越来越多的软件开发工作,企业也开始更在意这些任务究竟运行在哪里。Cursor 托管的云环境仍然是默认方案。每个智能体会运行在独立 VM 中,并提供隔离、密钥脱敏、出口流量控制和签名提交等能力。Self-Hosted
2026/9/3
Meta 最新的 Muse Spark 1.3 把重点继续放在智能体和编程任务上。它已经于 2026 年 9 月 2 日上线 Muse Code 和 Meta Model API,面向需要长时间执行、多轮工具调用以及复杂代码修改的工作流。这一版本明显加强了长任务处理能力。在一个持续很久的对话线程中,Muse Spark 1.3 可以同时跟进多个工作流,主动使用工具从杂乱、甚至互相冲突的信息里补充上下文,发现计划缺口后自行修正,并保留前面已经获得的信息,直到形成最终交付结果。它更适合被放进一个持续工作的智能体系统,而不只是完成一次性的问答。编程方面,Meta 增加了更多长周期代码任务训练。相比 Muse Spark 1.2,新版本减少
2026/9/3
Google 发布 Gemini 3.8:Flash 强化长任务与智能体,Cyber 专攻漏洞发现和修复Google 于 9 月 2 日发布 Gemini 3.8,这是六周内第三次更新 Flash 系列。新版本分为 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,两者共享同一套基础智能能力,但分别面向通用智能体工作流和网络安全场景。Gemini 3.8 Flash 继续保持 Flash 系列对速度和成本的侧重,同时明显加强软件工程、智能体任务以及多步骤推理。Google 表示,它在长周期软件工程测试 DeepSWE v1.1 中超过多数体量更大的前沿模型,在金融、法律等专业任务上也比 3.7 Fl