方法论
AI 不是人,但把它当一个人来管理,很多问题反而有了抓手。
BeAR 循环
赌、标、施、顾。AI 时代的一个 PDCA 变体,把不确定的探索变成可以复盘的循环。
赌 · Bet On
先下注,选定一个值得试的方向。AI 的能力边界不靠讨论确定,靠试出来。
标 · Benchmark
把「好」的标准先定下来。固定一批人工标注的样本作为基准,之后拿它对抗漂移。
施 · Action
小步执行。把任务切到一次能做完的尺寸,做完再拼,不追求一次到位。
顾 · Retrospective
回头复盘。有效的做法固化成资产,无效的假设直接丢掉,然后进入下一轮。
水位理论
AI 的水位一直在往上涨。
能浮在水面上的企业,就有继续向前的机会。被淹掉的往往不是因为做错了什么, 而是因为水位涨过了它。所以真正要盯的不是「这次做得对不对」, 而是「组织学得够不够快」。
人机协同的三种模式
区别在于谁负责完成工作。选错模式,比选错工具更容易出问题。
嵌入
AI 在流程里做一小段,人来衔接前后。最容易起步,也最容易看到效果。
Copilot
人主导,AI 在边上给建议与初稿。判断与责任始终在人这一侧。
智能体
AI 主导完成整件事,人只在关键节点把关。适合边界清晰、可验证的任务。
先做哪件事
场景不是越全越好。按落地难度和业务收益摆进二维,先做左上角那些。
- 01
左上角先做:难度低、收益高,能最快看到效果,也最容易让团队建立信心。
- 02
右上角排期做:收益高但要动系统,需要先立项、拆阶段。
- 03
右下角暂缓:难度高收益低,往往是「听起来很完整」的那一类。
怎么判断 AI 干得好不好
传统软件是对错二元的,AI 不是。评估 AI 的产出,是从「做得好」往下扣分, 按缺陷的类型分档。评的是思考结果的质量分布,不是一个布尔值。
- 方向对但事实核查不过,轻档
- 漏答,中档
- 答非所问,重档
- 事实偏移,也就是编造或张冠李戴,最重
落到工程上
标准件思维
大任务不要整体替换。把接口标准化,把任务做小,再按接口组装。切分本身就是设计。
先定标准,再看一致性
评估 AI 的产出,先把评分的标准写下来,再看结果稳不稳定。
减少人工,而不是消灭人工
把目标定在「减少人工」是当下可落地的;「完全替代」是几年尺度的长期目标。