我正在做什么

迈入纯 AI Coding 的未来

AI 已经彻底改变了软件工程师开发软件的方式。近期准备围绕以下三个方向开展研究。

01

准备中

热门话题横测

拿真实任务跑一遍

AI Coding 这边隔一阵就会冒出一个很火的说法。比如从年初开始,不少人在推通用工作流 skill;到了 7 月,又开始出现大量“应该抛弃这类 skill”的说法。与其只看谁说得更像那么回事,不如直接拿任务跑。

准备怎么测

准备短、中、长程任务,先用现在的旗舰 / Flash 模型跑,再换成这些 skill 火起来时的同档模型;同时放到 Codex 这种重型内置流程和 pi 这种极简 harness 里对照。看看同一个说法在哪些情况下成立,token 多花多少,成功率有没有提高,会不会其实只是 harness 在起作用。这些任务和指标最后需要做成一套能跨模型、skill 和 harness 复用的实景横评工具。

  • 短 / 中 / 长任务
  • 旗舰 / Flash 模型
  • Codex / pi
  • 实景横评工具

02

持续研究

AI 时代的软件工程

AI 写代码以后,Review 该怎么看

AI Coding 越来越像一种新的编程语言。既然代码主要是 Agent 写的,就不该默认人还要逐行 Review;但这不等于不 Review,而是要换一种看法。

准备尝试的方向

把 Review 从“看每一行代码”往上提几层:看架构图、数据流、状态边界和运行结果,再结合传统软件工程的东西去横测 TDD、SDD,或者其他乱七八糟的实践,到底什么真能提高 AI 出码质量。这部分最终需要形成一套面向 AI Coding 的新 Review 方法论,以及配套工具。

  • 架构图
  • 数据流
  • TDD / SDD
  • Review 方法 / 工具

03

做原型

能直接用的 Agent

先做点能跑的玩具

第三类是做一些很小、最好马上就能被人用的 Web Agent。先做到“能跑的玩具”这种程度,不急着上来就做通用平台。

先做什么

比如做一个 AI 版 AdGuard,让规则由 AI 自己生成和维护;或者把本站的“笨蛋谢琪 Agent”做出来,让人直接问我的项目、代码和经历,再根据问题动态生成更好理解的界面。前两类验证方法是否有效,第三类证明我能把 Agent Native 产品做出来。

  • 笨蛋谢琪 Agent
  • AI AdGuard
  • 直接能用
  • 先跑起来

还有一件事。

Trade Assistant

开发与验收中

先算能亏多少,再决定买多少。

将以损定量等交易仓位管理方法工具化,把风险预算、仓位计算、止盈止损与交易执行整合为统一工作流。交易内核已接入 Binance、OKX、Bybit、Bitget 和 Hyperliquid。

看产品讲解与开发复盘