Thoughts on AI, technology, and innovation
DramaClaw 用 Ports & Adapters 做到了「一份代码、两个发行版、零 fork」,并用 CI 硬门禁保证核心永不引用商业代码——这是我见过最彻底的开源/商业分割。但同一套 CI 里还有一条禁止项目自称「开源」的词表门禁,招牌 AI 助手在公开版里默认隐藏,22 个模型别名只在官方网关上解析。本文按源码逐层拆它的架构、验证闭环、「3D 片场」的真实产出,以及三条会咬人的许可证地雷。
Prime Agent 用持久化 IPython REPL 替代固定工具调用、用 Continual Harness 实现 agent 自我改写 harness 状态,在 ARC-AGI-3 上以 95.5% 超越人类基线——但 Factorio 实验中的 reward hacking 暴露了长时程自主 agent 的安全红线。
阿里开源的 Open Code Review 用确定性工程管道 + LLM Agent 的混合架构,在 50 个仓库、200 个 PR、1,505 个标注缺陷的基准上,以 Claude Code 1/9 的 token 消耗拿下更高准确率和 F1 得分。本文拆解其文件过滤五重门、per-file 双层审查、记忆三分区压缩和 19 类内置规则体系。
一个周末的逆向工程实验,7,196 Star,117 条 HN 评论。maderix 通过逆向 Apple 的私有 ANE API,在 M4 的 Neural Engine 上实现了完整的 Transformer 训练——包括反向传播。本文拆解其从 CoreML 到 IOKit 的全栈逆向路径、动态权重内核的 MIL 技巧,以及为什么 5-9% 的实际利用率反而是最有价值的数据。
huggingface/speech-to-speech 用模块化 VAD→STT→LLM→TTS 流水线 + OpenAI Realtime 兼容 WebSocket API,实现了一套完全可替换组件的本地语音 Agent 方案。截至2026年7月已获8,100+ Star,并在数千台 Reachy Mini 机器人上生产运行。本文拆解其四层流水线架构、跨平台组件矩阵和全本地部署路径。
Microsoft VibeVoice 是开源语音 AI 的标杆项目,截至2026年7月已获51,503 Star。它包含 ASR-7B(60分钟长音频转录+说话人分离)、TTS-1.5B(90分钟多说话人合成)、Realtime-0.5B(流式实时合成)和 BitNet 边缘推理引擎四款模型。本文拆解其 7.5Hz 连续语音 tokenizer、next-token diffusion 架构和 ASR-BitNet 的异构量化方案。
月之暗面开源了 FlashKDA——为 Kimi 模型定制的 Delta Attention 高性能 CUDA 内核,基于 CUTLASS 构建,在 H20 上实现 1.85-2.31x 加速,在 Blackwell GB200 上最高 3.27x。本文拆解其 CHUNK=16 的数值策略、双内核分拆架构、bf16 状态存储和 fp16 矩阵求逆等关键设计决策。
从零搭建 Promptfoo 并接入火山引擎 Ark Coding Plan 免费额度,踩过 npm 超时、推理模型 content 为空、not-contains 断言失效三个坑,最终 20/20 测试全部通过。本文记录完整配置和踩坑复盘。
OptMem 用 426 token 的 prompt + 一个零依赖 Python 文件实现了 AI Agent 永久记忆。本文拆解其定长记录、二叉树压缩和「位置即身份」的设计哲学,并与 Hermes Memory、nanobot Dream 做三方对比,揭示三种截然不同的 AI 记忆路线。
换个镜头主角就换脸,是 AI 短剧最贵的老毛病——个人创作者成片每分钟要磨 20–30 小时,大半耗在维持一致性。2025–2026 年行业已经收敛出一套范式:先定身份、锁死参考、再扇出镜头。本文拆解这套范式、参考图从单图到多视图角色板的取舍、锁一致性的三条技术路线,以及我把它装进 magicedit copilot 管线时补的两道防漂移门(运行时 VLM 身份校验 + 九宫格检查点)。
角色不换脸了,房间却在飘——墙色变了、门挪了位、招牌道具换了样。场景漂移是 AI 短剧里被讨论得更少、却同样破坏沉浸感的一半。这篇把场景一致性拆清楚:定场镜头作为空间锚点、从单张到多角度 set 参考的取舍、角色锚点与场景锚点正好相反的硬约束,以及场景独有的一维——空间接地(对着固定门窗家具定机位)。附我把它装进 magicedit copilot 管线的落地:no-people 硬约束、多角度 set 参考、运行时 VLM 场景校验门。
从短剧工厂(Toonflow ⭐11.7k)到 AI 原生视频编辑器(Frontstage),从 Agentic 框架(ViMax)到 Claude Code 插件(Remotion Superpowers)——本文对 8 款开源 AI 视频生成工具进行全维度横向对比,提炼出 5 条行业趋势和选型建议。
换个镜头角色就变脸,是 AI 视频最烦人的老毛病。九宫格分镜用一个朴素的物理事实治它:九格画在同一张画布上,模型天然让同一个人保持同一副样子。本文拆解它的作用、优缺点、主流工作流,以及我在自己产品管线里把它从罕见特例放宽为默认主力的取舍。
nanobot 是 2026 年上半年增长最快的开源 AI Agent 项目——2 月上线,7 月突破 45,777 Star。本文从架构、Goal 系统、Dream 记忆、多通道设计四个维度进行源码级拆解,并与 Hermes Agent 做横向对比,给出差异化分析和选型建议。
Deja Vu 提出「上下文稀疏性」——每个输入只激活少数注意力头和 MLP 神经元,其余可安全跳过。在 OPT-175B 上实现 2× 推理加速(对比 FasterTransformer)、6×(对比 HuggingFace),不损失精度、不牺牲 in-context learning 能力。
七月上旬,Lilian Weng 发表 Harness Engineering for Self-Improvement 长文,将 Harness 工程提升到递归自我改进的核心地位;Anthropic 密集发布 Managed Agents、Agent Skills 等工程实践;Cognition 发布 SWE-1.7 模型。本文速览海外 AI 工程博客的最新动态,并分析它们与国内 AI 工程实践的共鸣。
知道了 Harness 工程和 Loop 工程的概念之后,用什么工具落地?本文系统梳理 2024-2025 年活跃维护的 AI 智能体工程工具,覆盖工具定义、上下文组装、输出解析、安全门控、状态管理、上下文压缩、检查点、可观测性等全链路,帮你从零搭建或在现有框架上扩展自己的 agent 系统。
BMAD-METHOD 不是又一个「AI 编程技巧合集」——它是一套完整的 AI 驱动的敏捷开发方法论。50K Star、12+ 专业 Agent 角色、34+ 结构化工作流、从头脑风暴到部署的完整生命周期。本文拆解 BMAD 的四阶段流程、Party Mode 多角色协作、以及它与 ECC/Ralph 的生态位差异。
Clypra 是 AIEraDev 团队用 Tauri + React 构建的现代化视频编辑器,代表了开源视频编辑工具的技术选型新方向——用 Rust 替代 C++ 做性能层,用 React 替代 Qt 做 UI 层。本文从技术架构到同类对比,拆解这一选型的优势与挑战。
ECC 不是又一个「Claude Code 配置包」——它是 227K Star、230+ 贡献者、跨越 7 个 AI 编程助手的 Agent 操作系统。261 个技能、自进化学习层、安全扫描、跨会话记忆持久化、Token 优化——本文从架构到实战,拆解 ECC 如何让 AI Agent 从「一次性对话」变成「持续进化的工程系统」。