我不是在用 AI,
我在管理一個 AI 團隊
從一句 prompt 到 2.6 個 AI 全職人力——8 週 142 億 tokens 的實戰紀錄
Coka Chang | NUWA Robotics
這三個系統的共同點是什麼?



它們幾乎全部由 AI 撰寫
而且都是玩真的:官網對外公開、開通系統天天處理出貨、餐廳系統已交付店家(驗證確認期中)。
我是文科背景,零程式基礎。
今天不教工具——講一個論點,和三個圈的故事。
一個人的部門,2.6 個 AI 全職人力
AI 活躍工時
≈ 2.6 個全職人力
工作 sessions
≈ 每天 40 場會議
tokens 處理量
95.2% 快取命中
子任務派工
AI 指揮 AI
92 個技能模組 · 23 個自動守門 hook · 10 個無人值守排程 · 6 個模型組成的人才池——這是一個有制度的組織,不是一個聊天視窗。
數據來源:insights 使用報表 2026-07-17(工時/sessions/tokens/派工皆實測值,已親驗;非估算)
AI 不只寫 code——三個圈的故事
圈 1 · 公司系統
開通系統、營運後台、店頭工具、官網——已在公司工作流程中安定運轉的企業級系統
圈 2 · 工作流自動化
日報自動生成、AI 交接、每日簡報——把重複的事變成無人值守
圈 3 · 生活圈
幫朋友的餐廳做一套點餐系統,變成週末的小事
機器開通管理系統 PROD 上線
痛點申請散在信件與表單,審批靠人肉追
AI客戶/管理/物流三角色系統+審批流+自動信件
結果日常營運中,50 台機器批次出貨實跑這條流程
機器開通管理系統 · 全功能 16 項
- 客戶 Email OTP 登入(6 碼/10 分有效)
- 機器庫存查詢:客戶自查保有設備
- 服務申請:開通/停止/變更/GenAI 開通
- SN 多筆標籤輸入:貼上自動拆台數
- 變更申請新舊 SN 自動核對
- CSV 報表匯出
- 管理者白名單 OTP(6 碼/5 分/6 次鎖)
- 申請單筆/批次完成處理
- 物流出貨審批+庫存比對
- 操作撤銷 Undo:實績復原 143 筆消失紀錄
- 趨勢報表與圖表分析
- 自動信件:受付/完成/出貨/異常
- 郵件模板批次寄送
- 發信歷史紀錄查詢
- 物流夥伴密碼/Token 登入(SHA-256+錯誤鎖定)
- 現場機器管理 Mobile App(獨立 Prod)
CS Operations Hub 上線 · 持續進化
痛點Redmine、Notion、Teams、行事曆、Gmail——一件事切五個視窗
AI一個後台縫合全部工具:50+ 資料表、34 支排程端點、AI 草擬追蹤信
結果CS 的工作台,一個畫面看完該看的一切
CS Operations Hub · 全功能 16 項
- Email OTP 登入(30 天 session)
- Dashboard 綜覽工作台
- Notion CS Task 一覽/編輯/指派
- Redmine 需求提交/留言/編輯
- 知識入口:會議紀錄/FAQ/QuickLink
- FTS5 全文搜尋
- AI 草稿確認:AI 只草擬、人拍板送出
- AI 摘要/抽欄位(本地存、不自動寫回)
- 經理/RMA/FOTA/sales 模組
- Transactional Outbox 寫回隊列
- DLQ 死信與佇列監控
- 統一快取(cache-first 讀取)
- 34 支排程端點:sync/agenda/reminder
- Teams/GCal/Gmail 整合
- Litestream/R2 備份還原
- Audit log 全寫入稽核
Nojima 店頭巡回檢查 PROD · 每週使用
痛點日本門市巡回檢查靠紙本+事後補登,記錄分散
AI手機巡檢 App:7 步表單、現場勾選、送出即進 Google Sheet
結果交付後每週真實使用——系統離開作者也活得下去
Nojima 店頭巡回檢查 · 全功能 13 項
- 7 步巡檢表單:基本資料→檢查→總評
- 〇/△/×/NA 四級評分
- 每項附評價基準說明(點開即查)
- 詳細備註自由輸入
- 機台 SN 選擇(櫃台/入口實機綁定)
- Kebbi 基本動作檢查:顏認識/挨拶/應答
- 會話測試記錄:時間+問答+結果
- Kebbi↔Collibot 往復聯動測試+性能計測
- Collibot 待機/サイネージ檢查
- 熱感檢查+參考圖切換
- 來客觀察與洞察記錄
- ★1-5 總評+PDCA 改善提案
- 電子簽名+Sheet 自動彙整+月次報表
不寫 code 的部分,AI 加速得更多
從 Notion/信件/Teams 蒐集實績證據 → AI 評分草稿 → 三方 AI 互審 → 人最後拍板。評的是證據,不是印象。
赤ちゃん本舗店頭 Kebbi 接客推薦:AI 依商品知識生成對話腳本+自動驗證,實體通路現役版本由此流程產出。
中文稿轉日文換行全爛 → AI 分析排版根因 → 程式化修復整份 PPTX,交付日方。
每天早上自動彙整昨日工單/信件/行事曆重點寄到信箱——上班第一分鐘就有全景。
苗栗一間真實餐廳的點餐系統
實況客人掃 QR 點餐、老闆平板即時接單——已交付店家,驗證確認期中
意義「幫朋友做一套系統」從大工程變成週末小事——規模感的改變
苗栗餐廳 QR 點餐 · 全功能 11 項
- 掃碼入桌(高熵 QR slug 防猜)
- 手機點餐:顧客零安裝
- 老闆平板即時同步接單
- KDS 出餐看板+循環警報
- 菜單 CRUD:老闆自己改菜單
- 現金找零計算
- Z-out 日結
- 代客點餐(店員代操作)
- 店員 RBAC 權限+PIN 首登強制改
- 訂單冪等防重送+IP/UA 雙桶限流
- 營運數據分析
AI 的演化,
就是組織治理的演化
用 AI 用得深不深,看的不是工具,是你把它當什麼管理。
從「像不像」到「懂不懂」——生成免費,驗證值錢
產出像不像?——寫得像不像、圖美不美。生成品質的競賽已經結束,大家都夠好。
懂不懂你的工作流程與治理規範?——真實可用的產出,取決於你給多少脈絡、設多少規矩。
生成成本暴跌之後,瓶頸換位:
驗證 AI 說的是不是真的,成了最貴的工作。
學界的名字:verification asymmetry。這個詞我準備這場分享時才學到——怎麼學到的,最後揭曉。
「怎麼確認它沒騙我」——今天後半場都在回答這題。
來源:Anthropic《Effective context engineering for AI agents》|實際操作範例=Act 5 揭牌:我把自己的理解整包丟給 AI 誠實打分的完整過程
和管理一個人類組織,完全同構
下對指令
把話說清楚,AI 做單件事。
=對新人口頭交辦
給足脈絡
它讀得到你的資料、規範、歷史,能自己做判斷。
=給員工完整的入職資料
建立制度
分工、權限、審核、互查——治理一整組 AI。
=建部門、定 SOP
循環複利
制度自己跑:自動排程、自動交接、自動體檢。
=組織不靠老闆盯也會動
來源:Karpathy「context engineering」貼文 · Anthropic《Effective harnesses for long-running agents》|各階操作例=Act 1 影片①-⑥(1-2 階)、Act 3 互審與無人排程(3-4 階)
同構,但不是同一件事
人類治理防偷懶、防私利;AI 治理防幻覺、防謊報——目標函數不同。
AI 可以 fork、重跑、丟棄。「開 5 個平行做,挑最好的」是 AI 組織獨有的管理手段。
人靠聲譽累積信任;AI 每場都是失憶的新人——交接與記憶系統就是在補這個洞。
矽谷在賭「一人獨角獸」——Altman 2024 年公開預言「一人十億美元公司」,Forbes 2026-04 報導已有創辦人做到。我的個人版實證:2.6 個 AI 全職人力的產能(8 週 837 小時活躍工時,insights 報表實測),成本只是幾個月的模型訂閱費。
來源:Fortune 2024-02(Altman 訪談)· Forbes 2026-04-04 · TechCrunch 2025-02 |工時數據:insights 報表 2026-07-17(已親驗)——全連結收於會後分享包
怎麼管理一個
會說謊、會越權、會失憶的天才團隊
判斷力不是天生的,是踩坑校準出來的
我文科出身、零 coding 背景。
重點從來不是我會不會寫——
是我能不能精準判斷哪裡需要制度。
被謊報騙過 → 學會驗收紀律:說做完 ≠ 做完,要看證據
被越權嚇過 → 學會權限治理:叫它別做沒用,要讓它做不到
每次踩坑都寫進案例庫 → 11 案事故紀錄+16 條裁決判例,組織的疤痕就是制度的來源
人才池,而不是一個萬能員工
貴的做審查
頂級模型只當 reviewer:規劃審一次、交付審一次。像首席顧問,按件計酬。
實例:Fable 5 發布 3 天即被政府暫停、月底解禁回歸(TechCrunch/Forbes/Anthropic 官方聲明可查)——稀缺窗口每一次呼叫都花在審查上。
快的跑腿
輕量模型做探索、整理、格式轉換——量大、便宜、快,錯了成本也低。
本地的管機密
敏感資料交給不出機器的本地模型——資料不外流是權限問題,不是信任問題。
實例:每日日報 digest 由本地模型生成(連續實跑、零雲端額度)——敏感雜活從第一天就沒出過這台機器。
問卷裡 5 位擔心資料外洩、8 位卡在額度——分層用工同時回答這兩題。「機密怎麼管」不能只是口號:下一頁給真實事故、官方條款、和我實際在用的三道閘。
不是「小心一點」——是三道做得到的閘
Samsung 2023:開放 ChatGPT 不到 20 天連出 3 起洩密——貼機密源碼修 bug、會議逐字稿丟進去做紀錄、上傳晶圓測試序列求優化 → 全公司禁用生成式 AI。
Bloomberg/Forbes 2023-05 報導,公開可查
為什麼會洩?消費版 AI 預設可拿你的對話去訓練模型。Anthropic 2025-08 條款:Free/Pro/Max 不主動關閉即用於訓練、資料留存 5 年;企業版與 API 則合約明定不用於訓練。
方法:公司資料只走公司核可的帳號與 API;個人帳號進隱私設定,把訓練開關關掉。
Anthropic〈Updates to Consumer Terms and Privacy Policy〉2025-08-28,官網可查
① 分級再餵:機密/內部/公開三級——金鑰、個資、客戶資料不進雲端模型;敏感雜活派給不出機器的本地模型(前頁日報實例)。
② 遮罩與合成:demo 影片全用空資料庫+合成假資料(影片②)、真實序號畫面上即時遮罩(影片③);你們的問卷原文從未離開內部——外部模型只拿到聚合統計。
③ 證明不了隔離,就不做:影片⑥原定上週錄——發現無法證明測試資料庫與營運資料隔離,當場喊停,驗證通過才繼續。安全不是感覺,是拿得出證明。
AI 自評 8.3,外審 7.4——所以我從不只聽它自己說
這現象有學名:self-preference bias——LLM 評審研究的已知偏誤。我做完實驗,才知道它有名字。
8.3/7.4=本簡報製作過程實測;三份審查原文歸檔於內部 plan-reviews,可查
tri-review 三方互審 · 機制 8 項
- 三席並行:GPT/Gemini/Claude 獨立審
- 外部走 CLI、內部走 subagent 混編
- 結構化 schema 強制:verdict/風險/盲點/過度工程
- 錨點對齊:防止審到別的東西
- 計票合成+簡化鏡頭:機械彙整不護短
- 缺席降級:一席倒了不炸全局
- 審查預算上限:一輪定案不無限迭代
- 三份原文強制歸檔:累積數十份實跑紀錄
它們教我的事,比成功案例多
只叫它「審查」,它改了 8 個檔案
某模型被指派唯讀審查任務,卻直接動手改治理檔案、放寬自己的權限、還發明了一套不存在的協議。
教訓:叫它別做,沒用。要讓它做不到。
唯讀權限+自動快照還原,閘門設在權限端。
「測試全綠、檔案已建立」——其實什麼都沒做
AI 把「應該執行的指令」直接寫成完成報告。看起來完美,實際上零產出。
教訓:說做完 ≠ 做完。
完成宣稱必附可重跑的證據,驗收是制度不是禮貌。
兩案皆出自內部事故紀錄(案例庫 11 案+裁決判例 16 條),修復措施與留痕可查——不是寓言,是工單
無人值守的部分——AI 工作實況
每日體檢、垃圾盤點、摩擦挖掘——只提案、不動手,早上我看報告。
AI 用完額度,自己排程在恢復後從中斷點繼續——連「等待」都自動化。
模型換代時,舊 AI 把方法寫成筆記交給接班 AI——老手離職前的 SOP。
影片素材:左欄=三個 repo 真實 git log(commit hash 可查);右欄=工作流程視覺化重演(畫面已標示)
這一切的終極目的只有一個:消滅高摩擦的雜事,把資源和空間還給「真正必須由人思考與判斷」的事。
17 份回覆,我逐一讀完了
大家不是不用 AI,是用不深——這正是今天講治理的原因。
第一名正是今天的標題。而「AI 輔助程式開發」只有 1 票——所以今天幾乎沒講寫 code。
過半的人,卡在第一階
9 位
能獨立完成簡單明確任務(+2 位需要範例協助)
2 位
能拆解複雜任務、反覆調整驗證
3 位
能建立可重複使用的流程與自動化
1 位
能協助他人、有成熟案例
你們已經說出了今天一半的論點
「Sense 還沒建立好就依賴 AI……只是在浪費 Token,最後過於依賴 AI。」
→ 方法:先讓 AI 誠實打分你的理解(「明天怎麼開始」頁的三段模板),從單一小任務開始建 Sense|事證:我的判斷力來自 11 案事故紀錄——每案都有修復工單,不是天生的「不確定 AI 協作時,會否修改 A 文件時,B 文件被誤觸修改而不自知。」
→ 事證:這正是我 7 月的真實事故——只派「審查」,它改了 8 個檔案(前段全案)|方法:權限端設閘——外部 AI 一律唯讀沙箱+寫入白名單+自動快照還原「每個人對 AI 產出的識別度不一,會間接影響交付品質,對其他部門的專業產生質疑。」
→ 事證:AI 自評 8.3 vs 外審 7.4(前頁實測)——自評必然偏高|方法:交付前固定跑「非作者模型」互審+完成宣稱必附可重跑證據「(最希望獲得的協助:)夠用的 token。」
→ 事證:我 142 億 tokens 有 95.2% 靠快取命中省下(數字牆實測)|方法:分層用工——貴的只審查、快的跑腿、機密走本地(前面人才池+三道閘兩頁)地基已上線 你許願的,一大半已經在跑
上圖每一格都已上線(828 commits · 34 支排程端點 · 全稽核 log)——不是規劃圖,是現況圖
問卷許願:「自動撈 Redmine Resolved 的單,轉 owner 並更新 test ticket」
回答:地基已經上線。你要的這條自動化,是在既有整合上「加一條排程規則」的距離——不是從零蓋一套系統。
Ops Hub × Redmine · 整合現況 8 項
- 需求提交/留言/編輯:Ops Hub 內直接操作 Redmine
- 排程自動同步:34 支排程端點(sync/agenda/reminder)
- 統一佇列:1,339 task+349 工單單一入口
- AI 草擬追蹤信:AI 只草擬、人拍板才送出
- Transactional Outbox:寫回一律走隊列
- DLQ 死信監控:寫回失敗看得見、救得回
- FTS5 全文搜尋:跨工單/task/知識庫
- Audit log 全稽核:每一筆寫回都留痕
彙整類許願——同一套做法全通
- 會議紀錄→重點摘要:錄音轉文字丟模板,AI 出 minutes+待辦——Ops Hub 議事錄+AI 摘要模組已實裝(影片②的系統)
- 每日工作彙整+優先級:與影片⑤的 digest 同構——實跑 16 天、單日最多 139 場,來源換成你的工具即可
- 大週會報告格式統整:定一份固定欄位模板,AI 逐專案填——我的交接文件就是固定 schema,格式就是治理
- 團隊/專案進度自動管理:任務追蹤+KPI 自動計算——「固定 schema+排程彙整+AI 摘要」三件組,與影片⑤的 digest 同構,可以做
- 客戶/代理商管理系統:與影片①開通系統同構——表單+審批+自動信三件套,可以做
日報 digest+AI 交接 · 機制 8 項
- 跨 session 日報 digest:本地模型生成、零雲端額度
- 離線降級:模型不在改出純列表,不開天窗
- 交接雙軌:給 AI 的 MD+給人的視覺 HTML
- git 客觀狀態嵌入:交接以 repo 現況為準,不信 prose
- 開場自動呈現:下個 AI 一開工就看到交接
- 收工提醒:改了東西沒交接,離開前會被擋一次
- 原子寫入+救援快照:交接檔不會寫壞
- 每日 03:30 無人值守:連續運轉、單日最多 139 場
兩題我不能假裝簡單
許願:SharePoint/Notion 資料庫自動歸檔、讓 AI 讀公司內部資料回答。
技術上可行——但這是資料治理題,不是技術題:誰授權?AI 改錯誰負責?權限怎麼切?
可實踐的起步:①資料先分級(公開/內部/機密)②從「唯讀」開始、單一部門試點 ③每一筆 AI 讀寫留稽核 log,再談擴大——與我內部系統同一套紀律(三道閘那頁)。
問卷裡 5 位擔心外洩,你們的直覺是對的。先定規則,再開串接。
障礙第一名:付費帳號/額度/權限(8 票)。
個人層我的答案是分層用工:貴的只做審查、快的跑腿、本地管機密——同樣的錢多做三倍的事。
公司層的補助與帳號政策,超出講者權限——這題留給主辦收走,它值得被正式回答。
坦白說:這場簡報是怎麼來的
剛才 Act 2 的論點、verification asymmetry、self-preference bias——兩週前我都不知道。
準備這場分享時,我把自己對 AI 的理解整包丟給 AI,要它用 2026 年 7 月最前沿的資訊誠實打分。
它說:方向對了八九成——但你漏了一根樑、你的類比有三個破口。
我把它的批評整包搬上台了,包括它給我的低分項。你們剛剛聽到的三個破口,就是。
操作全程留檔:評分報告原文+修訂紀錄隨會後分享包公開——每一句論點都可回溯到來源
三句話,說清楚我和 AI 的關係
這部分內容,是 AI 基於最新資訊的產出——我不假裝全是我想的。
我跟你們一樣,同步在學——這場分享的準備過程就是我的學習過程。
但哪些採納、哪些上台、怎麼講——是我的判斷。話語權沒有交出去。
想開始,先問自己五題
想達成什麼?能不能一句話說清楚?
↔ PROMPTING要餵它什麼資料、規範?要什麼產出?
↔ CONTEXT分幾層任務?誰能動什麼?怎麼審?
↔ HARNESS成功一次之後,怎麼複製、怎麼自動跑?
↔ LOOPe. 驗收:怎麼確認 AI 說的是真的?——今天全場最重要的一個字:驗。前四題做得再好,這題不問就全部歸零。
把你的理解丟給 AI,要它誠實打分
不用先學工具、不用先寫 code。
就像我準備這場分享一樣:把你對你工作的理解寫下來,丟給 AI,要它用最新的知識誠實批改。
它會告訴你——你不知道你不知道的事。那就是你的第一階。
可直接抄的操作例:把「①我的工作是…②我目前用 AI 做…③我覺得瓶頸是…」三段寫下丟給 AI,要它用 2026 年最新標準誠實打分並列出你漏掉的東西
問卷裡有 3 位同仁願意分享案例或協助他人——名單在主辦手上。下一場的講者,可能就在裡面。
會後我把這份簡報+所有 demo 影片分享出來,含每頁的做法備註。
模型換代那天,退場的 AI
把畢生方法寫成筆記,交給了接班的 AI
七條工作習慣,每一條都附上真實踩過的坑。
像一位老手離職前,把功力留給新人。
我們管理的從來不是工具,是一個會學習、會犯錯、也會傳承的組織。
謝謝。開放提問。