Thoughts on AI, technology, and innovation
GitHub 上不存在高星的独立 script-writer agent skill,但 YouTube Script Writer 的 4 角色流水线和 OpenLucid 的平台预设矩阵提供了优秀模式。我们评估了视频/音频脚本结构化创作的能力缺口与自建方案。
Stagehand 的 act/extract/observe 三原语设计模式对 AI 浏览器自动化领域有重要启示,但 BrowserBase 云服务为付费模式。本文对比现有 agent-browser、browser-use、Playwright MCP 等方案,评估借鉴价值与自建可行性。
我们已有 4 个摘要 skill 覆盖主流场景,但 Map-Reduce 长文分块摘要、视频关键帧锚点、跨源综合摘要三大能力缺失。本文评估了 6 个 GitHub 项目和 6 种摘要模式,提出了优先级建议。
GitHub 上最完整的趋势监控 skill 套件 trend-radar 提供了 monitor→deep-dive→alert→forage→report 的闭环流程,但依赖付费 MCP server。我们评估了基于免费公开接口自建趋势监控的可行性。
小红书自动化生态的头部项目 MediaCrawler (18k stars) 提供了多平台爬虫能力,但小红书无公开 API,所有自动化均基于逆向工程,合规风险显著。建议仅提取 Playwright 反检测等通用组件,不建独立 XHS skill。
从源码层面深度对比 AgentScope Runtime 与 OpenAI Agents SDK 的沙箱执行机制:容器后端、安全加固、生产部署模式。你的场景适合哪一个?
Harness Engineering 是2025-2026年AI Agent领域涌现的新兴工程学科,专注于设计围绕AI模型的全部运行环境——上下文交付、工具接口、验证闭环、记忆系统和安全沙箱——决定了Agent在生产环境中的可靠性。本文系统梳理从提示词工程到Harness工程的演进路径、核心架构组件、关键开源项目、生产案例与实用落地路线图。
从源码级别拆解 Hermes Agent 的三层召回架构——内置记忆、会话搜索与 Hindsight 外部记忆提供者——并与 Claude Code、Cursor、Codex CLI、mem0、Zep、LangChain Memory、Letta 七个竞品进行系统对比。
调查 MCP Builder 生态系统——从 Anthropic 官方 create-python-server 到社区脚手架工具。分析 MCP Builder 到底是什么、做对了什么、缺失了什么,以及为什么 Hermes 可能需要自己的 MCP 工具工厂。
对 AI agent PowerPoint 生成工具的批判性评测——对比 python-pptx、pptxgenjs、markitdown 和我们现有的技能。测试幻灯片质量、AI 特有的陷阱,以及现有工具是否能产出不露馅的演示文稿。
Ralph Loop 生态全景深度解析——从 Geoffrey Huntley 的原始 Bash 循环到五个生产级实现。分析核心机制,对比各实现差异,探索如何将自主循环执行融入 Hermes Agent 的现有基础设施。
逐步记录如何将流行的 quality-playbook-generator 技能适配到 Hermes Skill Graph 2.0 中。我们没有复制 479 行指令,而是提取了通用的取证方法论,创建了两个可组合的技能,并丢弃了已有技能体系覆盖的部分。
深入对比三大技能创建框架:Anthropic Skills(182K 安装量)、OpenClaw Skill Creator 和 Hermes Skill Graph 2.0。分析各自的设计哲学、优势劣势,以及 Hermes 如何将最佳实践融合为分层组合模型。
全面调研 8 个 agent skill 类别——从 tmux 会话控制到 Playwright 测试——揭示哪些技能值得采用,哪些冗余,以及生态现状告诉我们关于 AI 智能体成熟度的什么信息。
NVIDIA 在 2026 年 4 月底发布了 Nemotron 3 Nano Omni——首个原生支持视频+音频+图像+文本的 30B 级开源多模态模型。我在消费级 RTX 4090 上完成了从下载到推理的全流程实测,记录下令人惊喜的速度、意外的中文能力、多模态的部署限制,以及对本地 AI 发展趋势的思考。
我们调研了四个 AI 音乐 agent skill:程序化 MIDI 生成的 EsshUwU、走 Suno API 的 Cynaps3、多模态工具集 vargHQ、以及已弃用的 fltman。结果很惨淡——要么依赖付费 API(一票否决),要么音质停留在 90 年代 SoundFont 水平。只有本地程序化生成路线值得关注。
三个 AI 长篇小说生成项目横向比较:Hermes Novel Generator(14 星)跑在 Hermes 里做 Scene Sandbox pipeline,NovelClaw(293 星)是哈工大团队搞的完整写作工作台,Morpheus(25 星)有三层记忆+知识图谱。各自适合什么场景,优缺点一览。
我们将 humanizer(Wikipedia 整理的 29 种英文 AI 写作模式)接入到六个技能中,覆盖博文管线和求职问候管线,并构建了 zh-anti-slop v2——从 patina 借用了触发条件/排除条件/语义风险框架,覆盖 20 种中文模式,全部分级了专业/日常/正式三种语域,防止去 AI 味的同时干掉专业性。
psy-core 把 AI agent 的每一次 memory 写入都记录进一条 HMAC 密封的哈希链。你可以追查 agent 在什么时候学会了什么、哪个 session 改了哪个 skill。本文拆解它的适配器架构、哈希链机制和安装流程。
Telepath 在画图之前会先读你的 Hermes Agent 的 memory。Hermes 越了解你,Telepath 问的问题就越少。输入一句模糊意图,输出图表、架构图或信息图——全部用 Kimi K2 驱动。2026 年 Hermes Agent Hackathon 参赛作品。