ai coding 半年小结

image-20260908234121972

那些历史: vibe-coding

just build, no ship

  • 一个通过openclaw 聊天开发上线的站点
  • 一份openclaw 个性化配置
  • 一个ios app
  • 一个macos app
  • gorequests 时隔几年 release 了个新版本
  • Robert github 协作机器人【服役中】
  • apisix-go golang 版本的apisix, 两年前搭了个架子,想不到 agent 能帮我完成接近 100% 的能力平迁
    • 2w 行 -> 10w 行 -> 37w 行 -> 48w 行 -> 38 w 行
  • ……

vibe-coding 意味着代码都不 review 了,直接合入,纯黑盒,功能正常就行。

那么也意味着,你得不到任何经验。

没有太大意义,大部分都弃坑了,只有少量能用的留下(但是也很快将被淘汰)

image-20260908234906083

image-20260908234910942

那些历史: openclaw

你还在用吗? 没有了,早格式化了

那么hermes 呢? 装了,删了

但是,我还在用 imate, 只不过,一个机器人只做一件事情

  • github 多模型 review 机器人
  • robert 协作机器人
  • 问题咨询机器人
  • ……

image-20260908234958642

那些有效的部分:agents.md

用 git 维护 AGENTS.md 并且软链所有 agent 使用同一份,迭代,优化

日积月累,加加减减, 最终得到了一份契合自己工作流的约束文档。

玄之又玄,有用没用谁也不知道,但是大部分情况是有用的。

当然,遇到差的模型,白搭。

另外,每一次模型进步,都意味着 AGENTS.md 重塑。 这个文件或许不会消失,但是会越来越小。

  • 从最早的一堆 DO NOT, 慢慢的变成一句简单的说明,agent 自主决策

那些有效的部分: 项目 agents.md

每个项目根路径 AGENTS.md + 核心模块目录 AGENTS.md

反复迭代,优化。 慢慢地,agent 能独立自主完成一些需求。

典型项目:

  • bk-cli (1.7W 行go)
  • 蓝鲸微网关(7 万行go)

那些有效的部分: 启用 memory

你将会得到意想不到的惊喜

  • A 项目改一个字段,agent 告诉你 B 项目的接口协议不兼容
  • C 项目加一个新配置,agent 问你 D 项目有级联的变更要不要一起提个 PR
  • F 项目有个字段不知道哪来的什么原因,agent 告诉你某年某月某日你的一个需求决策
  • …..

所以,最好一个机器,一个主力 agent

那些有用的部分: 使用git worktree

原先我的所有 SKILL 中, git worktree 是可选,当用户要求用的时候用。

后来,直接变成必选。

场景:多个任务并行

ps: vscode 支持 查看当前所有的worktree 并打开

image-20260909004422421

那些有效的部分: 通用 SKILLS

目标: 让 agent 自动调用这些 SKILL 去完成对应的事情。 不需要你多做派发或说明。

基于 superpowers 构建的 工作流体系,上下层层依赖,打造全面完备的工具入口。

image-20260909000220960

每一次模型进步,都意味着SKILL 得大重写。

gpt 5.5 -> 5.6 -> 6.0, superpowers 直接变成智障,更新到后面的版本才解决。

长期来看, SKILL 会消失,或者被 AGENTS.md 简单几句话直接覆盖。 但是短期,至少目前还是有用的

BTW: 6.0 又进一步简化了 SKILL, 更少的约束,更少的上下文。

那些有效的部分:快捷指令 SKILL

事不过三

image-20260910231649550

那些有效的部分: 多模型 review

github PR 使用 codex + claude 双模型, 配合本地项目代码自由探索,已经能 reivew 出绝大多数问题

另外cursor 的 /multi-model-review 也可以

汇总 review 报告之后,再选择一个比较聪明的模型进行确认、校验。最终修复那些【正确的】

企业微信截图_927c8a6b-fbd5-4dc6-9425-6243caff1f1e

那些有效的部分: cli and mcp

个人更喜欢 cli + skill,排拆 MCP

但是,这两者在处理确定需求的时候非常有用。

不过,建议克制评估后引入。过多是有害的。

那些有害的部分: 省 token 中间层

个人观点

rtk? graphy? 以及一切中间层。

token 省了多少是可量化的,但是大模型思考返回结果的质量是不可量化的。

纯 bash 流(rg, grep 等)才是最纯粹的。 (古法编程大规模重构中的查找替换)

PS:我支持 LSP,但是目前 codex 并不支持。

那些有害的部分: harness和编排

个人观点

每个人可以通过 AGENTS.md + skills 定制适合自己的开发流。

agent 有两种选择: 1. 大而全例如codex 或 claude 2. 简单可定制 pi or dsh 【我认同这两个方向,受益于 codex 的同时,希望pi or dsh 能够变成未来的一个不可或缺的方向】

但是想要妄图通过一堆 AGENTS.md + skills + 编排工作, 做通用化的 harness(个人很讨厌这个词),统一掉所有项目的开发,那是错误的方向(个人观点)。

  • 软约束没啥用,
  • 过量的上下文(各种 rules,skills)
  • 双份事实(代码一份,harness文档一份),
  • 各种中间层(例如 graphy)
  • 冲突、歧义、重复等等

对于现在这种中小型项目(20W 行代码以内),轻量的 AGENTS.md + 聪明的 agent 就够了。你不用丢一个语言规范文档给他,丢一个make lint 更有效。

未来应该是类似 pi/dsh 的定制 agent,为每个项目量身配置,加上足够聪明的模型。

那些现在已经不用的部分

你还在用 SDD 吗? 不用了, 文档根本没法 review,最终就是一堆污染(网关各个项目已经删光了)

你还在保留 superpowers 的doc 吗? 全部删掉了,只保留一份事实

你还在用 plan 模式吗? 不用了, gpt 5.6 开始没必要了,模型越来越聪明

你还在用 tdd 吗? 还在用,即使现在很多人认为没有用了

那些现在经常用的部分

  • grill-me
  • show-me
  • fast-*

以及社区不断冒出来的好用的东西

那些建议

  • 形成一套适合自己的工作流,agent 也好,skill 也好,cli/mcp 也好,需要反复淬炼,持续迭代优化
  • 多跟 agent 聊,追问。
    • 技术事实的获取门槛已经很低了,不必去啃书,啃代码
    • 但是你自己的理解、判断、决策,最终转换成自己的经验,这个非常重要。
    • 多探讨你自己的想法,观点;而不是被 agent 带着走
  • 我们始终要和复杂度做斗争, 而现在,agent 变成引入复杂度的源头,代码生成几乎零成本,动不动大几千行往里合,那么,是否整个codebase 还在你的掌控中?
  • 务实。 ai coding 炫技很容易,做到务实反而困难。o

image-20260909004205853

那些事实

交付的确更高效了,但是也更累了

image-20260909004205852

现在的 gpt 6 Astra low/medium, 已经能非常好的完成和交付任务,非常务实、高效。已经能做很多之前我需要花很多时间做的事情,或者我根本做不到的事情。

幻觉出现的概率越来越低,代码越来越稳。

未来模型肯定越来越聪明,并且也会有类似grok bot 、cloud agent 出现,慢慢地很多工作逐步被这些替代,甚至所有的工作被替代。

但是至少目前,还需要人类开发者来控制复杂度。

也许某一天,控制复杂度也不重要了。


aiagents

2243 Words

2026-09-10 15:00 +0000