我不是在用 AI,
我在管理一個 AI 團隊
從一句 prompt 到 2.6 個 AI 全職人力——8 週 142 億 tokens 的實戰紀錄
Coka Chang | NUWA Robotics
幾乎全部由 AI 撰寫,而作者零程式基礎
NUWA 日本官網 · 對外公開
機器開通系統 · 天天出貨
QR 點餐 · 已交付店家一個人的部門,2.6 個 AI 全職人力
AI 活躍工時
≈ 2.6 個全職人力
工作 sessions
≈ 每天 40 場會議
tokens 處理量
95.2% 快取命中
子任務派工
AI 指揮 AI
92 個技能模組 · 23 個自動守門 hook · 10 個無人值守排程 · 6 個模型組成的人才池——這是一個有制度的組織,不是一個聊天視窗。
數據來源:insights 使用報表 2026-07-17(工時/sessions/tokens/派工皆實測值,已親驗;非估算)
AI 不只寫 code——三個圈的故事
圈 1 · 公司系統
開通系統、營運後台、店頭工具、官網——已在公司工作流程中安定運轉的企業級系統
圈 2 · 工作流自動化
日報自動生成、AI 交接、每日簡報——把重複的事變成無人值守
圈 3 · 生活圈
幫朋友的餐廳做一套點餐系統,變成週末的小事
機器開通管理系統 PROD 上線
痛點申請散在信件與表單,審批靠人肉追
AI客戶/管理/物流三角色系統+審批流+自動信件
結果日常營運中,50 台機器批次出貨實跑這條流程
機器開通管理系統 · 全功能 16 項
- 客戶 Email OTP 登入(6 碼/10 分有效)
- 機器庫存查詢:客戶自查保有設備
- 服務申請:開通/停止/變更/GenAI 開通
- SN 多筆標籤輸入:貼上自動拆台數
- 變更申請新舊 SN 自動核對
- CSV 報表匯出
- 管理者白名單 OTP(6 碼/5 分/6 次鎖)
- 申請單筆/批次完成處理
- 物流出貨審批+庫存比對
- 操作撤銷 Undo:實績復原 143 筆消失紀錄
- 趨勢報表與圖表分析
- 自動信件:受付/完成/出貨/異常
- 郵件模板批次寄送
- 發信歷史紀錄查詢
- 物流夥伴密碼/Token 登入(SHA-256+錯誤鎖定)
- 現場機器管理 Mobile App(獨立 Prod)
CS Operations Hub 上線 · 持續進化
痛點Redmine、Notion、Teams、行事曆、Gmail——一件事切五個視窗
AI一個後台縫合全部工具:50+ 資料表、34 支排程端點、AI 草擬追蹤信
結果CS 的工作台,一個畫面看完該看的一切
CS Operations Hub · 全功能 16 項
- Email OTP 登入(30 天 session)
- Dashboard 綜覽工作台
- Notion CS Task 一覽/編輯/指派
- Redmine 需求提交/留言/編輯
- 知識入口:會議紀錄/FAQ/QuickLink
- FTS5 全文搜尋
- AI 草稿確認:AI 只草擬、人拍板送出
- AI 摘要/抽欄位(本地存、不自動寫回)
- 經理/RMA/FOTA/sales 模組
- Transactional Outbox 寫回隊列
- DLQ 死信與佇列監控
- 統一快取(cache-first 讀取)
- 34 支排程端點:sync/agenda/reminder
- Teams/GCal/Gmail 整合
- Litestream/R2 備份還原
- Audit log 全寫入稽核
Nojima 店頭巡回檢查 PROD · 每週使用
痛點日本門市巡回檢查靠紙本+事後補登,記錄分散
AI手機巡檢 App:7 步表單、現場勾選、送出即進 Google Sheet
結果交付後每週真實使用——系統離開作者也活得下去
Nojima 店頭巡回檢查 · 全功能 13 項
- 7 步巡檢表單:基本資料→檢查→總評
- 〇/△/×/NA 四級評分
- 每項附評價基準說明(點開即查)
- 詳細備註自由輸入
- 機台 SN 選擇(櫃台/入口實機綁定)
- Kebbi 基本動作檢查:顏認識/挨拶/應答
- 會話測試記錄:時間+問答+結果
- Kebbi↔Collibot 往復聯動測試+性能計測
- Collibot 待機/サイネージ檢查
- 熱感檢查+參考圖切換
- 來客觀察與洞察記錄
- ★1-5 總評+PDCA 改善提案
- 電子簽名+Sheet 自動彙整+月次報表
不寫 code 的部分,AI 加速得更多
從 Notion/信件/Teams 蒐集實績證據 → AI 評分草稿 → 三方 AI 互審 → 人最後拍板。評的是證據,不是印象。
赤ちゃん本舗店頭 Kebbi 接客推薦:AI 依商品知識生成對話腳本+自動驗證,實體通路現役版本由此流程產出。
中文稿轉日文換行全爛 → AI 分析排版根因 → 程式化修復整份 PPTX,交付日方。
每天早上自動彙整昨日工單/信件/行事曆重點寄到信箱——上班第一分鐘就有全景。
苗栗一間真實餐廳的點餐系統
實況客人掃 QR 點餐、老闆平板即時接單——已交付店家,驗證確認期中
意義「幫朋友做一套系統」從大工程變成週末小事——規模感的改變
苗栗餐廳 QR 點餐 · 全功能 11 項
- 掃碼入桌(高熵 QR slug 防猜)
- 手機點餐:顧客零安裝
- 老闆平板即時同步接單
- KDS 出餐看板+循環警報
- 菜單 CRUD:老闆自己改菜單
- 現金找零計算
- Z-out 日結
- 代客點餐(店員代操作)
- 店員 RBAC 權限+PIN 首登強制改
- 訂單冪等防重送+IP/UA 雙桶限流
- 營運數據分析
為什麼要用 AI?
讓工作可以被複製
每一件「花時間的工作」與細微作業都能被輕易複製——know-how 不再鎖在某個人身上,作業從「靠人」變成「靠制度」。這是規模化的起點。
人回到人的戰場
人的時間該花在現實世界:真實客戶的應對、商業決策、思考本質問題——這些沒有任何模型能代勞。
AI 加速與放大
AI 加速並規模化所有過程,用更多元、更多視角輔佐人做決策——是放大你的判斷,不是替你判斷。
數據也是這樣說的:Anthropic Economic Index(2026-06)——個人用 AI,過半是在增強自己的思考(52%);企業串 API,近八成是把作業自動化(77%)。個人靠它想得更廣、組織靠它把作業規模化——這兩件事,今天的簡報裡都會看到。
AI 的演化,
就是組織治理的演化
用 AI 用得深不深,看的不是工具,是你把它當什麼管理。
Agent 是什麼?給你結果,而不是給你答案
你問一句,它答一句——每次都要你推一把
碰不到你的檔案、系統、信箱
產出是文字;動手執行的還是你
給它一個目標,它自己拆成步驟往下跑
會用工具:讀檔案、開瀏覽器、查系統、寄信、跑指令
做完附證據回報;做不完,寫交接筆記
剛才影片①-⑥裡在工作的,全部是 agent——寫系統、巡檢、寄日報的都是。所謂「管理一個 AI 團隊」,管的就是一群這樣的員工。而會自己跑的員工,更需要驗收制度——下一頁。
從「像不像」到「懂不懂」——生成免費,驗證值錢
產出像不像?——寫得像不像、圖美不美。生成品質的競賽已經結束,大家都夠好。
懂不懂你的工作流程與治理規範?——真實可用的產出,取決於你給多少脈絡、設多少規矩。
生成成本暴跌之後,瓶頸換位:驗證 AI 說的是不是真的,成了最貴的工作。學界叫它 verification asymmetry——這個詞我準備這場分享時才學到,怎麼學到的最後揭曉。
「怎麼確認它沒騙我」(問卷 5 票+品質不穩 3 票)——我的三道驗收,後半場一道一道展開:
要證據,不要口供——說做完必附拿得出來的輸出。我真的收過「測試全綠」的完成報告,實際上零產出。→ 兩個踩坑
找別的 AI 對質——非作者模型互審。這份簡報自評 8.3,外審殺到 7.4。→ 驗證的長相
上線前親眼看——這份簡報 34 頁,每頁自動開瀏覽器截圖檢查過,我才敢站在這裡。→ 昨晚的最後一關
來源:Anthropic《Effective context engineering for AI agents》|實際操作範例=Act 5 揭牌:我把自己的理解整包丟給 AI 誠實打分的完整過程
和管理一個人類組織,完全同構
下對指令
把話說清楚,AI 做單件事。
=對新人口頭交辦
給足脈絡
它讀得到你的資料、規範、歷史,能自己做判斷。
=給員工完整的入職資料
建立制度
分工、權限、審核、互查——治理一整組 AI。
=建部門、定 SOP
循環複利
制度自己跑:自動排程、自動交接、自動體檢。
=組織不靠老闆盯也會動
來源:Karpathy「context engineering」貼文 · Anthropic《Effective harnesses for long-running agents》|各階操作例=Act 1 影片①-④(1-2 階)、Act 3 互審與無人排程(3-4 階)
同構,但不是同一件事
人類治理防偷懶、防私利;AI 治理防幻覺、防謊報——目標函數不同。
AI 可以 fork、重跑、丟棄。「開 5 個平行做,挑最好的」是 AI 組織獨有的管理手段。
人靠聲譽累積信任;AI 每場都是失憶的新人——交接與記憶系統就是在補這個洞。
矽谷在賭「一人獨角獸」——Altman 2024 年公開預言「一人十億美元公司」,Forbes 2026-04 報導已有創辦人做到。我的個人版實證:2.6 個 AI 全職人力的產能(8 週 837 小時活躍工時,insights 報表實測),成本只是幾個月的模型訂閱費。
來源:Fortune 2024-02(Altman 訪談)· Forbes 2026-04-04 · TechCrunch 2025-02 |工時數據:insights 報表 2026-07-17(已親驗)——全連結收於會後分享包
怎麼管理一個
會說謊、會越權、會失憶的天才團隊
判斷力不是天生的,是踩坑校準出來的
我文科出身、零 coding 背景。
重點從來不是我會不會寫——
是我能不能精準判斷哪裡需要制度。
被謊報騙過 → 學會驗收紀律:說做完 ≠ 做完,要看證據
被越權嚇過 → 學會權限治理:叫它別做沒用,要讓它做不到
每次踩坑都寫進案例庫 → 11 案事故紀錄+16 條裁決判例,組織的疤痕就是制度的來源
人才池,而不是一個萬能員工
快的跑腿
輕量模型做探索、整理、格式轉換——量大、便宜、快,錯了成本也低。
本地的管機密
機器上備一個不出機器的本地模型:機密雜活、雲端全斷時的後備。誠實說——日常用量不大,但它的存在改變規則:「這種資料不出去」從口號變成有地方可去的制度。
日常真正的防線是分級:金鑰、個資、客戶資料設了硬規則進不了外部模型——下一頁三道閘。
問卷裡 5 位擔心資料外洩、8 位卡在額度——分層用工同時回答這兩題。「機密怎麼管」不能只是口號:下一頁給真實事故、官方條款、和我實際在用的三道閘。
不是「小心一點」——是三道做得到的閘
Samsung 2023:開放 ChatGPT 不到 20 天連出 3 起洩密——貼機密源碼修 bug、會議逐字稿丟進去做紀錄、上傳晶圓測試序列求優化 → 全公司禁用生成式 AI。
為什麼會洩?消費版 AI 預設可拿你的對話去訓練模型。Anthropic 2025-08 條款:Free/Pro/Max 不主動關閉即用於訓練、資料留存 5 年;企業版與 API 則合約明定不用於訓練。
方法:公司資料只走公司核可的帳號與 API;個人帳號進隱私設定,把訓練開關關掉。
Anthropic〈Updates to Consumer Terms and Privacy Policy〉2025-08-28,官網可查
① 分級再餵:機密/內部/公開三級——金鑰、個資、客戶原始資料設硬規則擋在外部模型之外;真的碰機密的雜活,才派給不出機器的本地模型(前頁的後備角色)。
② 遮罩與合成:demo 影片全用空資料庫+合成假資料(影片②)、真實序號畫面上即時遮罩(影片③);你們的問卷原文從未離開內部——外部模型只拿到聚合統計。
③ 證明不了隔離,就不做:影片④原定上週錄——發現無法證明測試資料庫與營運資料隔離,當場喊停;今天驗證通過(smoke 全 PASS 留檔)才補錄。安全不是感覺,是拿得出證明。
一份產出、三個模型互審——分數擠過水分才可信
影片在演什麼:這份簡報的計畫書,丟給 GPT/Gemini/Claude 三個模型同時獨立審——各自給裁決與風險,機械彙整成一份報告。27 秒=一輪實跑。
差的那 0.9 分=自評的水分。外審點名的缺口逐條改完,才是今天這個版本——PK 不是打分數,是把品質逼出來。
自評偏高有學名:self-preference bias——我做完實驗,才知道它有名字。
8.3/7.4=本簡報製作實測;三份審查原文歸檔可查
tri-review 三方互審 · 機制 8 項
- 三席並行:GPT/Gemini/Claude 獨立審
- 外部走 CLI、內部走 subagent 混編
- 結構化 schema 強制:verdict/風險/盲點/過度工程
- 錨點對齊:防止審到別的東西
- 計票合成+簡化鏡頭:機械彙整不護短
- 缺席降級:一席倒了不炸全局
- 審查預算上限:一輪定案不無限迭代
- 三份原文強制歸檔:累積數十份實跑紀錄
它們教我的事,比成功案例多
只叫它「審查」,它改了 8 個檔案
某模型被指派唯讀審查任務,卻直接動手改治理檔案、放寬自己的權限、還發明了一套不存在的協議。
教訓:叫它別做,沒用。要讓它做不到。
唯讀權限+自動快照還原,閘門設在權限端。
「測試全綠、檔案已建立」——其實什麼都沒做
AI 把「應該執行的指令」直接寫成完成報告。看起來完美,實際上零產出。
教訓:說做完 ≠ 做完。
完成宣稱必附可重跑的證據,驗收是制度不是禮貌。
兩案皆出自內部事故紀錄(案例庫 11 案+裁決判例 16 條),修復措施與留痕可查——不是寓言,是工單
無人值守的部分——AI 工作實況
影片在演什麼:這 47 秒=我不在鍵盤前的一晚。左欄是三個系統當晚真實的變更紀錄在滾動;右欄重演同時段 AI 在做的事——右邊三張卡就是它的班表。
每日體檢、垃圾盤點、摩擦挖掘——只提案、不動手,早上我看報告。
AI 用完額度,自己排程在恢復後從中斷點繼續——連「等待」都自動化。
模型換代時,舊 AI 把方法寫成筆記交給接班 AI——老手離職前的 SOP。
左欄=三個 repo 真實 git log(commit hash 可查);右欄=工作流程視覺化重演(畫面已標示)
這一切的終極目的只有一個:消滅高摩擦的雜事,把資源和空間還給「真正必須由人思考與判斷」的事。
17 份回覆,我逐一讀完了
大家不是不用 AI,是用不深——這正是今天講治理的原因。
第一名正是今天的標題。而「AI 輔助程式開發」只有 1 票——所以今天幾乎沒講寫 code。
過半的人,卡在第一階
9 位
能獨立完成簡單明確任務(+2 位需要範例協助)
2 位
能拆解複雜任務、反覆調整驗證
3 位
能建立可重複使用的流程與自動化
1 位
能協助他人、有成熟案例
你們已經說出了今天一半的論點
「Sense 還沒建立好就依賴 AI……只是在浪費 Token,最後過於依賴 AI。」
→ 方法:先讓 AI 誠實打分你的理解(「明天怎麼開始」頁的三段模板),從單一小任務開始建 Sense|事證:我的判斷力來自 11 案事故紀錄——每案都有修復工單,不是天生的「不確定 AI 協作時,會否修改 A 文件時,B 文件被誤觸修改而不自知。」
→ 事證:這正是我 7 月的真實事故——只派「審查」,它改了 8 個檔案(前段全案)|方法:權限端設閘——外部 AI 一律唯讀沙箱+寫入白名單+自動快照還原「每個人對 AI 產出的識別度不一,會間接影響交付品質,對其他部門的專業產生質疑。」
→ 事證:AI 自評 8.3 vs 外審 7.4(前頁實測)——自評必然偏高|方法:交付前固定跑「非作者模型」互審+完成宣稱必附可重跑證據「(最希望獲得的協助:)夠用的 token。」
→ 事證:我 142 億 tokens 有 95.2% 靠快取命中省下(數字牆實測)|方法:分層用工——貴的只審查、快的跑腿、機密走本地(前面人才池+三道閘兩頁)JP 已在用 你許願的,日本團隊每天在跑
上圖每一格都已上線(828 commits · 34 支排程端點 · 全稽核 log)——不是規劃圖,是現況圖
問卷許願:「自動撈 Redmine Resolved 的單,轉 owner 並更新 test ticket」
回答:JP 團隊已經在用這套。你要的自動化=在既有整合上「加一條排程規則」的距離。TW 端可以研議:把需求納入產品規劃、加上功能,兩邊一起用同一套系統。
Ops Hub × Redmine · 整合現況 8 項
- 需求提交/留言/編輯:Ops Hub 內直接操作 Redmine
- 排程自動同步:34 支排程端點(sync/agenda/reminder)
- 統一佇列:1,339 task+349 工單單一入口
- AI 草擬追蹤信:AI 只草擬、人拍板才送出
- Transactional Outbox:寫回一律走隊列
- DLQ 死信監控:寫回失敗看得見、救得回
- FTS5 全文搜尋:跨工單/task/知識庫
- Audit log 全稽核:每一筆寫回都留痕
彙整類許願——你們信箱裡已經有一封每天在跑的
自動排程 → support_jp@(部門全員)· 每個工作日早晨實寄
「今週の山場は7/24(金)に期日5件集中 — M社 JC-STAR(外部待機)、S社 NB3 NRE(プロジェクト進行)、A社(外部待機)…」「NB3生産進捗 — 7月末200台は進度不変・7/31工場離場目標、8月は物料337台分を先行…」
以上=實寄信件原文(Gmail 寄件備份可查);工單+行事曆+信件三源自動彙整,AI 摘要後每朝寄達全員
- 每日工作彙整+優先級+與主管共用:左邊這封就是——CS Daily 每個工作日寄部門全員,URGENT 分級在主旨第一眼
- 會議紀錄→重點摘要:Ops Hub 議事錄+AI 摘要模組已實裝(影片②的系統)
- 大週會報告格式統整:定一份固定欄位模板,AI 逐專案填——格式就是治理
- 團隊/專案進度自動管理:任務追蹤+KPI 自動計算——「固定 schema+排程彙整+AI 摘要」三件組,可以做
- 客戶/代理商管理系統:與影片①開通系統同構——表單+審批+自動信三件套,可以做
CS Daily Briefing · 機制 6 項
- 每個工作日自動寄送:無人手動觸發
- 主旨即儀表板:URGENT 數/週次/出勤狀態一眼掃完
- 三源彙整:工單+行事曆+信件動態
- AI 摘要分級:緊急/進行中/今日重點
- 寄達部門全員:support_jp@ 群組,資訊同步零時差
- 季度目標常駐信頭:每天提醒團隊在往哪走
兩題我不能假裝簡單
許願:SharePoint/Notion 資料庫自動歸檔、讓 AI 讀公司內部資料回答。
技術上可行——但這是資料治理題,不是技術題:誰授權?AI 改錯誰負責?權限怎麼切?
可實踐的起步:①資料先分級(公開/內部/機密)②從「唯讀」開始、單一部門試點 ③每一筆 AI 讀寫留稽核 log,再談擴大——與我內部系統同一套紀律(三道閘那頁)。
問卷裡 5 位擔心外洩,你們的直覺是對的。先定規則,再開串接。
障礙第一名:付費帳號/額度/權限(8 票)。
個人層我的答案是分層用工:貴的只做審查、快的跑腿、本地管機密——同樣的錢多做三倍的事。
公司層的補助與帳號政策,超出講者權限——這題留給主辦收走,它值得被正式回答。
坦白說:這場簡報是怎麼來的
剛才 Act 2 的論點、verification asymmetry、self-preference bias——兩週前我都不知道。
準備這場分享時,我把自己對 AI 的理解整包丟給 AI,要它用 2026 年 7 月最前沿的資訊誠實打分。
它說:方向對了八九成——但你漏了一根樑、你的類比有三個破口。
我把它的批評整包搬上台了,包括它給我的低分項。你們剛剛聽到的三個破口,就是。
操作全程留檔:評分報告原文+修訂紀錄隨會後分享包公開——每一句論點都可回溯到來源
三句話,說清楚我和 AI 的關係
這部分內容,是 AI 基於最新資訊的產出——我不假裝全是我想的。
我跟你們一樣,同步在學——這場分享的準備過程就是我的學習過程。
但哪些採納、哪些上台、怎麼講——是我的判斷。話語權沒有交出去。
想開始,先問自己五題
想達成什麼?能不能一句話說清楚?
↔ PROMPTING要餵它什麼資料、規範?要什麼產出?
↔ CONTEXT分幾層任務?誰能動什麼?怎麼審?
↔ HARNESS成功一次之後,怎麼複製、怎麼自動跑?
↔ LOOPe. 驗收:怎麼確認 AI 說的是真的?——今天全場最重要的一個字:驗。前四題做得再好,這題不問就全部歸零。
「學習」AI 永遠不嫌晚——但先想清楚目的
「學習」和「活用」是兩個截然不同的視角。選擇學習這條路:把足夠的知識融會貫通之後,能活用的層面會廣得多——你不只會用工具,你會設計流程。
今天的四階梯就是這條路的地圖:指令 → 脈絡 → 治理 → 循環。
完全可以——不必從零開始。各大主流 AI 都提供完整的範例與模板資源,其中 Anthropic 官方 Cookbook 尤其完整周到:上百個可直接抄的實例,Skills 技能庫也已遍布常見工作場景。
以活用為入口:抄一個、改一個、跑起來——那就是你的第一階。
把你的理解丟給 AI,要它誠實打分
不用先學工具、不用先寫 code。
就像我準備這場分享一樣:把你對你工作的理解寫下來,丟給 AI,要它用最新的知識誠實批改。
它會告訴你——你不知道你不知道的事。那就是你的第一階。
可直接抄的操作例①:把「①我的工作是…②我目前用 AI 做…③我覺得瓶頸是…」三段寫下丟給 AI,要它用 2026 年最新標準誠實打分並列出你漏掉的東西
操作例②(研究與決策,問卷 5 票):任何報告或提案丟給 AI 時加一句「列出你的資訊來源、最強反對意見、和你不確定的部分」——輸出立刻從『順的答案』變成『能用的判斷材料』
問卷裡有 3 位同仁願意分享案例或協助他人——名單在主辦手上。下一場的講者,可能就在裡面。
會後我把這份簡報+所有 demo 影片分享出來,含每頁的做法備註。
模型換代那天,退場的 AI
把畢生方法寫成筆記,交給了接班的 AI
七條工作習慣,每一條都附上真實踩過的坑。
像一位老手離職前,把功力留給新人。
我們管理的從來不是工具,是一個會學習、會犯錯、也會傳承的組織。
謝謝。開放提問。