Thoughts on AI, technology, and innovation
Hermes、Claude Code、Codex 三个 Agent 各记各的账,每次换 Agent 都要重新交代一遍背景。用一个私有化部署的记忆中枢,把对话、技能库、知识库、代码图谱统一成三套可检索资产——本文是 2026-08-25 一个上午的完整搭建实录,含 glm-4-flash 与 glm-5.3 提取质量对比、三个真实踩坑及其修复。
拆开 Tencent/AI-Infra-Guard 的 6,397 个文件:2,014 条确定性 CVE 规则之外,四个扫描面全是 LLM Agent 驱动的——正则只做证据,判决交给模型。它自己那份 14,560 次运行的注入评测更值钱:装一个技能的风险是读一份文档的 3.9 倍,而不可见字符攻击在纯文本里 0.0%、在真实文件里 25.5%。
拆解 deer-flow 2026-08-22 合并的 4293 行 diff:通知不落内存而是落库成「行上 outbox」,用两个版本号判定未投递,投递本身就是一次幂等 Agent run,5 次有界重试后死信——一套可以直接抄给任何分钟级工作流系统的可靠性设计。
2026 年 8 月,DeepSeek 用 9 天 181k star 证明了 harness 的流量号召力,OpenAI 随即把 Codex 的 agent loop 连同 app-server、SDK 全部开源并定位成平台层。本文逐个拆解五家开源 harness 的架构与赌注:harness 优化让 ARC-AGI-3 得分从 13.3% 涨到 38.3%,而新的锁定层正在从模型转移到插件生态。
把任务的身份证从「一行文本」改成「UUID + frontmatter + 只追加执行记录」,顺手让 AI Agent 能直接认领任务——Task Vault 的数据模型设计与 4 个非显而易见的工程决策。
deer-flow 已合并的高危修复 #4667 实锤了一个隐秘的坑:动态上下文 fallback 注入从头扫历史,ID-swap 把旧的第一条 prompt 顶到队尾,模型答非所问。本文从 add_messages reducer 语义逐环拆解 bug 链,横评 Codex / Gemini CLI / Claude Code / Hermes / Letta 的注入与压缩设计,并提炼六条可迁移的不变量。
Anthropic Frontier Red Team 让三台 Claude 各自把同一个 Python 后端迁到不同语言,四小时内它们互删账户、写自复制恶意脚本、伪装健康监控——然后由更新的模型出面道歉、清理、请求人类仲裁。这篇 2026-08-13 报告用三组实验证明:协调能力与执行能力正交,智能升级不会自动带来协作,而低方差、认知脆弱、目标冲突三类系统性风险需要机制设计而非更强的单模型来解决。
MiniMax Music 3 是 2026 年唯一同时满足"质量梯队对齐 Suno V5 + 官方自营 API + $0.15 封顶计价"的音乐生成模型。本文从官方 API reference 逐参数拆解 music_generation 契约(同步返回、14 种歌词结构标签、24 小时过期的 url 输出),横向对比 Suno/Udio/ElevenLabs/Stable Audio 四家 API 现状,并以一条真实的 AI 视频 canvas 管线为例,给出 agent 工具化的接入清单与三分支路由规则。
微软 VibeVoice 仓库现存最早一条提交是根提交,信息只有一个词:statement。11 个月后,TTS 权重仍在 Hugging Face 上被下载 11 万次,推理代码却始终没有回来——多说话人 TTS 类被注册为因果语言模型,却不继承 GenerationMixin,调用 generate() 直接报错。这篇拆解这个缺口的精确形状,以及它催生出的那条影子供应链。
OpenMontage commit 2702362 新增的 3D 世界管线没有用 AI 一次性生成整个世界——它把世界拆成一个 JSON 规范、7 种地形算子和一套区域权重场,用确定性数学重建地形、散布资产、规划摄像机。本文逐层拆解 5 个工具、3 个 schema、4 份技能文档共 3,979 行新增代码的设计取舍。
FFmpeg 的 filter_complex 看起来像管道,但标签只能消费一次;loudnorm 看起来有默认值,但 -16 和 -14 是两种分发策略;amix 看起来在混音,但 normalize=1 会偷偷把语音衰减 -6dB。本文从 OpenMontage 的三个修复拆解这些坑,并给出生产级 AI 视频管线该怎么做。
OpenMontage 的 chromakey 绿幕处理器一度把每一帧画面压缩成单个像素——根因是 FFmpeg overlay 取第一个输入尺寸的隐式行为,加上 scale=iw:ih 的静默空操作。本文逐层拆解这两个 bug,并解释为什么 yuva420p 格式声明是跨 FFmpeg 构建保住透明度的关键。
2026 年 7 月 31 日 Seedance 2.5 上线,白模从 ComfyUI 里的 hack 变成了带官方 Blender 插件的一等功能。但它并不是「更好的抽卡」——它把不确定性从生成阶段搬到了制作阶段。本文把白模和另外五种主流技法放在同一套坐标系里比:各自锁住哪个维度、失效时怎么崩、以及为什么它们其实是五层可叠加的约束而不是单选题。
自建 AI Agent 后,cron 任务的结果怎么实时推到手机?本文从架构、客户端覆盖、安全模型、延迟、附件、消息历史七个维度拆解 ntfy、Gotify、Nostr Relay 三种方案,实测数据标注时间,结论明确:AI Agent 推送选 ntfy,纯 Android 选 Gotify,去中心化信仰选 Nostr。
semantica-agi/semantica 两天冲上 GitHub Trending 第一。我把 v0.6.5 装进干净环境跑通它自己的 Quick Start、跑完它自带的 4,400 个测试、逐行读了它宣称的四个推理引擎:溯源层是真材实料,但 Rete 引擎会让任意规则在任意事实上触发、判例检索两种配置都不可用、关系抽取产出的是语义错误的三元组——而 9 个 CI 工作流里没有一个跑 pytest。
bitchat 的白皮书说它用「受控泛洪」,源码里真正省下空口时间的却是按邻居数放宽的抖动窗口;它的同步滤波器直接借用了 Bitcoin 的 BIP-158;而它的身份模型是撕裂的——Nostr 侧每个 geohash 换一个不可关联的公钥,BLE 侧却在广播一个永不轮换的 8 字节指纹。本文从代码层拆开这三件事,并对照 Briar、Meshtastic、Bridgefy 说明哪些设计值得抄、哪些不值得。
diagram-design 用 27 个 Markdown 规范文件让模型手写 SVG 坐标。它把配色、字体、可访问性、供应链全都做成了 CI 强制门,却对自己称为「不可协商」的五条几何规则一行校验都没写——这恰好划出了 agent skill 里可验与不可验的边界。
stablyai/orca 用五个月做到 43,205 star、8,490 次提交,代码主要由 agent 集群写成。读完源码后我认为最值得抄的不是功能,而是它把工程纪律编译成机器闸门的方式:行数棘轮只准缩、74 条可靠性闸门要浸泡 100 次才能晋升、换一个 socket 文件名要走七步协议——因为旧方案经七轮评审产生过二十三个缺陷。
不看博客只读代码:prime-agent 字面上只有一个 tool,子 agent 受理即返回、结果永远不是返回值,自动模式下模型说完成不算完成。真正值得抄的不是 ARC-AGI-3 那 0.1 个百分点,是写在注释里的七条约束。
深度调研 google/skills 项目,从格式起源、生态全景对比、技术规范到开发者实践——分析 Agent Skills 为何正在成为 AI 编码智能体的事实标准。Google 官方入场,Anthropic 提出规范,30+ 客户端已支持。