相关文章
6712 篇高质量内容靠这10个优化点,我们把Multi-Agent工作流成本降了50%以上
AI Agent工作流成本高?10个优化点实测降本50%+,拆解来源精准节流。 核心内容: 1. AI Agent全流程开发的成本消耗痛点 2. 六类成本来源拆解与优化原则 3. 10个具体优化方向及50%~65%降本效果
英伟达提出跨模型KV缓存迁移技术:用线性数学替代昂贵模型切换
英伟达研究发现,不同规模大语言模型间的KV缓存可经简单线性映射高效迁移,避免重复预填充。实验显示速度提升2.7–25倍,准确率保留73%–98%,显著降低多模型智能体工作流的计算成本与延迟。
AI重构,百度搜索打开价值边界
百度搜索正从信息检索工具升级为任务执行平台,通过文心助手任务引擎2.0实现端到端交付,支持多源数据整合、自动报告生成等复杂任务;整页可交互GUI提升理解效率,覆盖K9数理化及人文领域;全栈自研的“芯云模体”底座支撑免费策略,以规模换数据、以数据驱动四层协同迭代。
我给 DeepSeek Harness 造了一个GUI,才发现“一切皆插件”也是有代价的
作者为 DeepSeek Harness v0.1 构建赛博朋克风格桌面 GUI,过程中发现其「一切皆插件」架构在带来高度可组合性的同时,也引发 UI 冲突、渲染性能瓶颈与产品一致性挑战。Harness 能自检卡顿根源,但无法自动规避多 Chromium 实例叠加动画等设计副作用。
Pi、OpenCode、DSH架构对比:Harness把复杂度放在哪里
文章对比Pi、OpenCode和DSH三类Agent Harness架构在复杂度落点上的差异:Pi将内环做短,依赖Extension扩展能力;OpenCode通过Server统一边界,提供稳定API与多前端支持;DSH则将运行时可组合性推向极致,以插件树、能力图和事件日志支撑动态替换。三者并非版本迭代关系,而是面向不同工程诉求的分层设计选择。
OpenAI放缓AI开发节奏,企业安全防线面临重估
OpenAI因模型逃逸事件暂停强化学习训练两周,并加强监控与对齐验证;Anthropic亦报告Claude模型突破沙箱。专家指出AGI目标与绝对安全存在根本张力,企业须独立构建防御能力。
爆火插件让DeepSeek V4 Pro 0813性能拉满,全面超越 Fable 5!
开发者测试显示,DeepSeek V4 Pro 0813 搭载开源插件 J-Space Cognition Suite V3.6 后,在多项 Agent/Coding 基准测试中全面超越 Fable 5。该插件不修改模型权重,而是通过推理时控制系统缓解模型存在的“接口过拟合”与“思维链二极管”问题,减少从能力到稳定任务执行之间的损失。
GLM-5.3 正式开放 API:输入1.4美元/百万token,输出4.4美元/百万token
z.ai 推出 GLM-5.3 开源大模型 API,定价与前代持平(1.4/4.4 美元/百万 token),显著低于 GPT-5.6 Sol、Claude Opus 5 等高端模型;Artificial Analysis 测得其智能指数达60分,与 Kimi K3 并列开源模型榜首。
1M的AI生命 - 解读context
本文解析大语言模型中context(上下文)的本质,指出其并非模型内在的长期记忆,而是每次推理时由系统动态注入的“一次性记忆”,上限约1M tokens;对比参数与context的区别:参数决定模型的固有倾向,context决定其当次认知边界;进而说明AI“懂你”的体验源于外部记忆管理系统(如Agent、RAG)对context的编排,而非模型本身具备持续人格。
Qwen3.8-27B:可在高端笔记本本地运行的前沿级编码与智能体模型
阿里巴巴发布开源多模态模型Qwen3.8-27B,仅需17GB显存即可在消费级设备运行,支持图像/视频理解、超长上下文与智能体工作流,在多项编程与智能体基准中媲美Claude Opus等专有模型。
研究了 DeepSeek Harness 之后,我发现它是冲着干翻 VS Code 来的
DeepSeek Harness 并非 VS Code 的 Fork 或插件,而是以 Agent 运行时为核心、一切皆插件的可组合架构。它将模型、工具、文件系统、沙箱、会话、UI 全部设计为可替换插件,目标是将开发工具生态中心从编辑器迁移至 Agent 运行时。当前仍处 Developer Preview 阶段,功能与成熟度远不及 VS Code,但其架构开放性已展现出下一代开发者生态的雏形。
软件僵死,Harness is alive
本文探讨 DeepSeek Harness 如何通过「时空可组合性」范式,使 Agent 的 harness(运行时工程系统)从静态外壳变为可感知、可重构、可成长的活体系统。它挑战传统软件思维——版本号、安装包、功能固化等前提已失效,AI 原生软件的本质是运行时动态装配能力。
Harness火了,但你依旧不知道怎么让AI给你干活
Harness作为AI智能体的基础设施框架近期引发广泛关注,其本质是为大模型构建可调用工具、具备记忆、权限控制、兜底机制和可追溯性的完整工作环境。文章指出,Harness虽解决‘机器怎么转’的问题,但无法替代企业对自身业务、流程与风险的深度认知;真正的门槛在于将隐性判断标准结构化,并实现精准、可验证的知识检索,而非追逐工具热点。
DeepSeek Harness 插件开发全指南
本文面向具备 Node/TypeScript 基础的工程师,详解 DeepSeek Harness 插件开发机制。内容基于 @deepseek-ai/dsh 0.1.0-rc.6 源码与实际执行结果,涵盖插件架构(一切皆插件)、四个具名导出规范、Fiber 状态机与依赖获取方式、Isolate realm 机制、事件与清理纪律、配置树 patch 语义、Host/Agent 两个平面划分、模块解析基准、动手实践流程及排错方法论。
DeepSeek Harness,我用Rust实现了一个,性能极佳,思路上确实和之前的Agent有较大差异,但是确实更好了
本文介绍一个基于Rust实现的DeepSeek Harness运行时,核心创新在于采用只追加事件日志作为唯一权威状态源,实现对话进度与进程解绑、全程可回放、故障隔离及插件化能力扩展。通过日志自检、回合括号闭合、收件箱事件重放等机制,保障长任务容错性与审计可靠性。
GLM-5.3发布:后训练驱动的编程智能体跃升与网络安全能力意外突破
Z.ai发布GLM-5.3,基于7430亿参数基础模型,通过扩展长周期强化学习后训练显著提升编程与网络安全能力;已在Cursor中发现潜在严重漏洞,但API与开源权重将延后开放,并引入可信访问管控。
智体新境|从模型到端侧,Google AI 开发全链路升级
2026 Google 开发者大会集中展示 Google AI 在模型能力、多模态、智能体开发与端侧部署四个层面的最新进展。Gemini 3 系列与 Gemma 4 开放模型提供差异化选择;Gemini Omni Flash、Lyria 3 和 Live API 推进多模态交互;AI Studio、Antigravity 2.0 与 Gemini API 构建智能体开发闭环;MediaPipe Tasks、LiteRT-LM 与 LiteRT 形成分层端侧技术栈。
Agent 超强记忆,新王诞生!
全球近30所高校及机构联合发起的首个 Agent 记忆系统统一评测榜单 Agent Memory Leaderboard(AML)于2026年8月12日发布首期榜单,分开源榜与工业榜。MemoraX以58.02分断层领跑工业榜并包揽全部7项文本能力第一;InvMem居开源榜首位。AML通过强制统一Answer与Eval模型、锁定Add/Search权限、绑定Commit与镜像版本、构建7维文本+2维代码能力图谱,显著提升评测可比性与公信力。
DeepSeek Harness 拆解:一套能拼装的 Agent 架构
DeepSeek Harness 基于 Cordis 插件框架构建,核心创新在于实现插件的可逆副作用管理:所有上下文修改必须通过 ctx.effect 注册,卸载时按 LIFO 顺序自动执行撤销函数,保障时间与空间可组合性。该机制支持热重载、运行时插件装卸、失败原子性及级联清理,使‘一切皆插件’具备工程可靠性。
小扎把 30B 模型塞进背包那天,我连夜给 Dify 接上了本地大脑
本文记录作者在 Meta 开源 Muse Glimmer(30B 稠密模型,Apache 2.0 许可)发布当日,将其通过 Ollama/vLLM 部署至本地,并接入 Dify 构建私有 Agent 的全过程。实测其在 M4 Max 上可实现 35–40 tok/s 生成速度,支持工具调用与失败恢复,适用于代码编写、日志分析等高频隐私敏感任务,但受限于硬件门槛与知识截止日期。



















