方法论

AI 不是人,但把它当一个人来管理,很多问题反而有了抓手。

BeAR 循环

赌、标、施、顾。AI 时代的一个 PDCA 变体,把不确定的探索变成可以复盘的循环。

赌 · Bet On标 · Benchmark施 · Action顾 · Retrospective再下注
赌 · Bet On
先下注,选定一个值得试的方向。AI 的能力边界不靠讨论确定,靠试出来。
标 · Benchmark
把「好」的标准先定下来。固定一批人工标注的样本作为基准,之后拿它对抗漂移。
施 · Action
小步执行。把任务切到一次能做完的尺寸,做完再拼,不追求一次到位。
顾 · Retrospective
回头复盘。有效的做法固化成资产,无效的假设直接丢掉,然后进入下一轮。

水位理论

AI 的水位一直在往上涨。

能浮在水面上的企业,就有继续向前的机会。被淹掉的往往不是因为做错了什么, 而是因为水位涨过了它。所以真正要盯的不是「这次做得对不对」, 而是「组织学得够不够快」。

人机协同的三种模式

区别在于谁负责完成工作。选错模式,比选错工具更容易出问题。

嵌入
AI 在流程里做一小段,人来衔接前后。最容易起步,也最容易看到效果。
Copilot
人主导,AI 在边上给建议与初稿。判断与责任始终在人这一侧。
智能体
AI 主导完成整件事,人只在关键节点把关。适合边界清晰、可验证的任务。

先做哪件事

场景不是越全越好。按落地难度和业务收益摆进二维,先做左上角那些。

  1. 01

    左上角先做:难度低、收益高,能最快看到效果,也最容易让团队建立信心。

  2. 02

    右上角排期做:收益高但要动系统,需要先立项、拆阶段。

  3. 03

    右下角暂缓:难度高收益低,往往是「听起来很完整」的那一类。

落地难度业务收益先做排期做顺手做暂缓报表与周报生成文档与知识沉淀客服与答复跨系统数据打通全流程自动替代

怎么判断 AI 干得好不好

传统软件是对错二元的,AI 不是。评估 AI 的产出,是从「做得好」往下扣分, 按缺陷的类型分档。评的是思考结果的质量分布,不是一个布尔值。

  • 方向对但事实核查不过,轻档
  • 漏答,中档
  • 答非所问,重档
  • 事实偏移,也就是编造或张冠李戴,最重
编造最危险,因为它读起来通顺。所以标准要先定,再看一致性。

落到工程上

标准件思维
大任务不要整体替换。把接口标准化,把任务做小,再按接口组装。切分本身就是设计。
先定标准,再看一致性
评估 AI 的产出,先把评分的标准写下来,再看结果稳不稳定。
减少人工,而不是消灭人工
把目标定在「减少人工」是当下可落地的;「完全替代」是几年尺度的长期目标。