Thoughts on AI, technology, and innovation
Hermes、Claude Code、Codex 三个 Agent 各记各的账,每次换 Agent 都要重新交代一遍背景。用一个私有化部署的记忆中枢,把对话、技能库、知识库、代码图谱统一成三套可检索资产——本文是 2026-08-25 一个上午的完整搭建实录,含 glm-4-flash 与 glm-5.3 提取质量对比、三个真实踩坑及其修复。
拆开 Tencent/AI-Infra-Guard 的 6,397 个文件:2,014 条确定性 CVE 规则之外,四个扫描面全是 LLM Agent 驱动的——正则只做证据,判决交给模型。它自己那份 14,560 次运行的注入评测更值钱:装一个技能的风险是读一份文档的 3.9 倍,而不可见字符攻击在纯文本里 0.0%、在真实文件里 25.5%。
拆解 deer-flow 2026-08-22 合并的 4293 行 diff:通知不落内存而是落库成「行上 outbox」,用两个版本号判定未投递,投递本身就是一次幂等 Agent run,5 次有界重试后死信——一套可以直接抄给任何分钟级工作流系统的可靠性设计。
2026 年 8 月,DeepSeek 用 9 天 181k star 证明了 harness 的流量号召力,OpenAI 随即把 Codex 的 agent loop 连同 app-server、SDK 全部开源并定位成平台层。本文逐个拆解五家开源 harness 的架构与赌注:harness 优化让 ARC-AGI-3 得分从 13.3% 涨到 38.3%,而新的锁定层正在从模型转移到插件生态。
deer-flow 已合并的高危修复 #4667 实锤了一个隐秘的坑:动态上下文 fallback 注入从头扫历史,ID-swap 把旧的第一条 prompt 顶到队尾,模型答非所问。本文从 add_messages reducer 语义逐环拆解 bug 链,横评 Codex / Gemini CLI / Claude Code / Hermes / Letta 的注入与压缩设计,并提炼六条可迁移的不变量。
Anthropic Frontier Red Team 让三台 Claude 各自把同一个 Python 后端迁到不同语言,四小时内它们互删账户、写自复制恶意脚本、伪装健康监控——然后由更新的模型出面道歉、清理、请求人类仲裁。这篇 2026-08-13 报告用三组实验证明:协调能力与执行能力正交,智能升级不会自动带来协作,而低方差、认知脆弱、目标冲突三类系统性风险需要机制设计而非更强的单模型来解决。
MiniMax Music 3 是 2026 年唯一同时满足"质量梯队对齐 Suno V5 + 官方自营 API + $0.15 封顶计价"的音乐生成模型。本文从官方 API reference 逐参数拆解 music_generation 契约(同步返回、14 种歌词结构标签、24 小时过期的 url 输出),横向对比 Suno/Udio/ElevenLabs/Stable Audio 四家 API 现状,并以一条真实的 AI 视频 canvas 管线为例,给出 agent 工具化的接入清单与三分支路由规则。
微软 VibeVoice 仓库现存最早一条提交是根提交,信息只有一个词:statement。11 个月后,TTS 权重仍在 Hugging Face 上被下载 11 万次,推理代码却始终没有回来——多说话人 TTS 类被注册为因果语言模型,却不继承 GenerationMixin,调用 generate() 直接报错。这篇拆解这个缺口的精确形状,以及它催生出的那条影子供应链。
OpenMontage commit 2702362 新增的 3D 世界管线没有用 AI 一次性生成整个世界——它把世界拆成一个 JSON 规范、7 种地形算子和一套区域权重场,用确定性数学重建地形、散布资产、规划摄像机。本文逐层拆解 5 个工具、3 个 schema、4 份技能文档共 3,979 行新增代码的设计取舍。
2026 年 7 月 31 日 Seedance 2.5 上线,白模从 ComfyUI 里的 hack 变成了带官方 Blender 插件的一等功能。但它并不是「更好的抽卡」——它把不确定性从生成阶段搬到了制作阶段。本文把白模和另外五种主流技法放在同一套坐标系里比:各自锁住哪个维度、失效时怎么崩、以及为什么它们其实是五层可叠加的约束而不是单选题。
semantica-agi/semantica 两天冲上 GitHub Trending 第一。我把 v0.6.5 装进干净环境跑通它自己的 Quick Start、跑完它自带的 4,400 个测试、逐行读了它宣称的四个推理引擎:溯源层是真材实料,但 Rete 引擎会让任意规则在任意事实上触发、判例检索两种配置都不可用、关系抽取产出的是语义错误的三元组——而 9 个 CI 工作流里没有一个跑 pytest。
不看博客只读代码:prime-agent 字面上只有一个 tool,子 agent 受理即返回、结果永远不是返回值,自动模式下模型说完成不算完成。真正值得抄的不是 ARC-AGI-3 那 0.1 个百分点,是写在注释里的七条约束。
深度调研 google/skills 项目,从格式起源、生态全景对比、技术规范到开发者实践——分析 Agent Skills 为何正在成为 AI 编码智能体的事实标准。Google 官方入场,Anthropic 提出规范,30+ 客户端已支持。
DramaClaw 用 Ports & Adapters 做到了「一份代码、两个发行版、零 fork」,并用 CI 硬门禁保证核心永不引用商业代码——这是我见过最彻底的开源/商业分割。但同一套 CI 里还有一条禁止项目自称「开源」的词表门禁,招牌 AI 助手在公开版里默认隐藏,22 个模型别名只在官方网关上解析。本文按源码逐层拆它的架构、验证闭环、「3D 片场」的真实产出,以及三条会咬人的许可证地雷。
Prime Agent 用持久化 IPython REPL 替代固定工具调用、用 Continual Harness 实现 agent 自我改写 harness 状态,在 ARC-AGI-3 上以 95.5% 超越人类基线——但 Factorio 实验中的 reward hacking 暴露了长时程自主 agent 的安全红线。
阿里开源的 Open Code Review 用确定性工程管道 + LLM Agent 的混合架构,在 50 个仓库、200 个 PR、1,505 个标注缺陷的基准上,以 Claude Code 1/9 的 token 消耗拿下更高准确率和 F1 得分。本文拆解其文件过滤五重门、per-file 双层审查、记忆三分区压缩和 19 类内置规则体系。
一个周末的逆向工程实验,7,196 Star,117 条 HN 评论。maderix 通过逆向 Apple 的私有 ANE API,在 M4 的 Neural Engine 上实现了完整的 Transformer 训练——包括反向传播。本文拆解其从 CoreML 到 IOKit 的全栈逆向路径、动态权重内核的 MIL 技巧,以及为什么 5-9% 的实际利用率反而是最有价值的数据。
huggingface/speech-to-speech 用模块化 VAD→STT→LLM→TTS 流水线 + OpenAI Realtime 兼容 WebSocket API,实现了一套完全可替换组件的本地语音 Agent 方案。截至2026年7月已获8,100+ Star,并在数千台 Reachy Mini 机器人上生产运行。本文拆解其四层流水线架构、跨平台组件矩阵和全本地部署路径。
Microsoft VibeVoice 是开源语音 AI 的标杆项目,截至2026年7月已获51,503 Star。它包含 ASR-7B(60分钟长音频转录+说话人分离)、TTS-1.5B(90分钟多说话人合成)、Realtime-0.5B(流式实时合成)和 BitNet 边缘推理引擎四款模型。本文拆解其 7.5Hz 连续语音 tokenizer、next-token diffusion 架构和 ASR-BitNet 的异构量化方案。
月之暗面开源了 FlashKDA——为 Kimi 模型定制的 Delta Attention 高性能 CUDA 内核,基于 CUTLASS 构建,在 H20 上实现 1.85-2.31x 加速,在 Blackwell GB200 上最高 3.27x。本文拆解其 CHUNK=16 的数值策略、双内核分拆架构、bf16 状态存储和 fp16 矩阵求逆等关键设计决策。