白話拆解 RAG:傳產也聽得懂的 AI 知識庫技術

企業 AI 落地研究所|Casper/Max|2026-10-10 建稿,2026-10-11(週日)錄製。

錄製資訊(不口播)

依據 訪綱。與 企業 RAG 那集 同日錄、互補:那集的測試數字與事故細節這裡只說「上集講過」,不重念。稿面口白約 6,500 字,照念約 26~30 分,加停頓與即興估 34~40 分,未試念。

每個概念一個生活比喻+一個通用傳產例子,不講特定公司或人;料號 A-1023 等都是虛構示意。第三方說法都是改寫並講出處;精誠、白白說大模型兩支是本機轉寫未校對,只講概念。唯一選填的【待 Max 補】在第 7 段,沒補就照稿。

0|Hook 與開場:RAG 是一條生產線

Casper: 你問公司的 AI「這個料號的外徑多少」,它三秒就回答了。可是這三秒裡,它其實做了六、七件事:把文件切成小塊、把文字變成一串數字、在幾萬塊裡找最像的、再挑一次、塞進提示、最後才寫答案。

歡迎來到企業 AI 落地研究所。上一集我們聊企業 RAG 為什麼常答錯,今天換個角度,用白話把 RAG 裡面的技術一站一站拆開。一樣邀請到 Max。Max,先用一句話講整條流程?

Max: 我會把它想成一條工廠生產線,分兩段。第一段是事前準備:把文件切成小塊,每一塊轉成一串數字,存進索引。第二段是有人發問的時候:問題也轉成數字,去找最像的幾塊,挑過一次,跟問題一起組成提示交給模型,模型寫答案,最後附上出處。

Casper: 生產線的話,品質看哪一站?

Max: 看最弱的那一站。切壞了、找錯了、塞太多了,後面模型再強都救不回來。所以今天每一站都講一下,它在做什麼、會在哪裡壞。

1|Embedding 與向量:把意思變成座標

Casper: 第一個大家最常聽到、也最聽不懂的:embedding、向量。白話是什麼?

Max: 有一種專門的模型,叫 embedding 模型,它會把一段文字變成一長串數字。你可以把這串數字想成「意思的座標」。意思越接近的兩段文字,座標就越近。

Casper: 有比喻嗎?

Max: 超市貨架。醬油跟醋擺在一起,洗衣精在另一區。你就算不知道商品名稱,只要走到對的區域,也找得到。向量檢索就是這樣:你的問題也被換成一個座標,系統去看哪些段落離它最近。

Casper: 放到工廠呢?

Max: 例如品管問「出貨前要做哪些檢驗」,文件標題寫的是「成品檢驗作業標準」,字面上沒有一個字一樣,但意思很近,向量就找得到。這是它最厲害的地方。

Casper: 那它的弱點?

Max: 它找的是「意思像」,不是「正確」。料號 A-1023 跟 A-1032,對它來說意思幾乎一樣,可是在工廠裡是兩個完全不同的東西。還有兩個實務提醒:embedding 模型要挑中文表現好的;而且換了 embedding 模型,所有文件要重新算一次座標,索引要整批重建。

2|切塊策略:文件要怎麼切

Casper: 你剛剛說要先把文件切成小塊。為什麼要切?

Max: 因為一整份文件太長,意思也太雜。一本作業手冊裡有十幾個步驟,如果整本當成一個座標,它就會落在一個很模糊的位置,什麼問題都有點像、又都不太像。所以要切成一塊一塊,找的單位是「塊」。

Casper: 切大切小有差嗎?

Max: 差很多。我常用切蛋糕比喻:切太碎,每一口只吃到奶油,沒有蛋糕;切太大,一口吞不下。最好是沿著夾層切。

切太小,就是斷章取義,答案的前因後果不見了;切太大,一塊裡什麼都有,找得到但不精準,還會吃掉後面要講的上下文空間。

Casper: 那「沿著夾層切」是怎麼切?

Max: 常見做法有幾種。最簡單是固定長度,而且前後重疊一小段,避免一句話剛好被切斷。好一點是依標題、章節、步驟來切。再來,每一塊都帶上身分證,就是 metadata:哪份文件、哪一章、哪個版本、生效日期。之後要篩版本、附出處,全靠這個。

Casper: 傳產的例子?

Max: 作業標準就依步驟切,一個步驟一塊。規格表要特別小心,表頭跟數字一定要在同一塊;切開了,找到的那塊就只有一排數字,AI 不知道那是外徑還是重量。至於一塊要多少字,沒有標準答案,要拿自己的文件測。

3|檢索與重排:先海選、再複試

Casper: 切好、存好了。有人發問,那幾塊是怎麼排出來的?

Max: 兩輪。第一輪是向量檢索,速度很快,先抓出最像的幾十塊。第二輪是重排,英文叫 reranker。它會把「問題」跟「每一塊」放在一起仔細讀一遍,重新打分數,只留下最相關的幾塊。

Casper: 比喻?

Max: 徵才。先用履歷的條件篩出三十個人,這是海選;再一個一個面試,挑五個,這是複試。複試比較慢,但比較準。

Casper: 放到工廠?

Max: 業務問「某型號馬達能不能接 220V」。海選會抓到所有提到電壓的段落,各種型號都有;複試會把那個型號的規格頁排到最前面。上集提過,有廠商的測試光是加一層重排就明顯變好,比換模型便宜。

Casper: 重排跟「AI 會不會說不知道」有關嗎?

Max: 有,很有關。向量檢索永遠找得到「最近的幾塊」,就算你問的問題跟公司文件完全無關。精誠有一支教學影片講得很清楚:重排打完分數,低於門檻的就丟掉;全部丟光,就直接回答找不到。回到徵才:沒有人及格,就不錄取,不要硬挑一個。

4|混合檢索:關鍵字+向量

Casper: 既然向量這麼聰明,為什麼還要關鍵字搜尋?

Max: 因為兩個擅長的事不一樣。關鍵字檢索找「字一模一樣」的,向量找「意思像」的。比喻就是找人:叫名字最準;可是你只記得「那個戴眼鏡、做品保的」,就只能靠描述。

Casper: 工廠裡哪些要靠名字?

Max: 料號、型號、客戶名、法規條號、圖號。「A-1023 的公差」一定要關鍵字;「哪一種材質比較耐高溫」就要靠向量。所以實務上兩種一起跑,結果合併,再交給重排,這叫混合檢索。柏瀚 Roger Lin 有一支影片專門講這個做法;上集那份大型測試裡,關鍵字的表現也不輸向量。

5|組裝提示與上下文視窗

Casper: 找到那幾塊之後,怎麼交給模型?

Max: 系統會組一份提示,大概三個部分。第一是指示:只能根據下面的資料回答、找不到就說不知道、每句附出處。第二是剛剛找到的那幾塊。第三才是使用者的問題。模型看到的就是這一整包。

Casper: 上下文視窗是什麼?

Max: 就是模型一次能讀的長度上限。塞越多,越貴、越慢,而且重點可能被淹沒。比喻是開會前給主管的資料夾:放三頁重點,他會看;塞一百頁,他一定漏看。

Casper: 所以不是塞越多越好。

Max: 對。業務問一個料號的報價,只要塞那個料號的規格頁跟報價規則,不用把整本型錄塞進去。這也是為什麼前面切塊、重排要做好,因為它們決定了資料夾裡放的是哪三頁。

6|幻覺與引用

Casper: 都給它資料了,為什麼還會亂講?

Max: 因為模型的本能是寫出一段通順的答案。資料不夠的時候,它會用自己以前背過的知識去補,而且講得很有自信。這就是幻覺。

Casper: 怎麼防?

Max: 三層。第一,提示裡要求只能根據資料回答。第二,如果檢索結果是零塊,乾脆不要呼叫模型,直接回答找不到;這是白白說大模型那支影片提的做法。第三,每句附引用,讓人可以點回原文。

Casper: 有引用就可以信了嗎?

Max: 不行,引用不等於正確。比喻是學生寫報告附參考文獻,老師要翻開文獻核對,不是看有沒有附就給分。工廠的例子:問某材料的耐溫,公司文件裡其實沒有,模型用網路上的常識回了一個數字。沒有引用,這個數字就不能信;有引用,也要點進去看那段真的有寫這個數字。

7|表格、PDF 與 OCR

Casper: 傳產的文件一堆表格、一堆掃描檔,RAG 吃得下嗎?

Max: 這是傳產最容易出事的一站。先講 PDF:PDF 是「排版」,不是「資料」。它記的是每個字擺在頁面哪裡,轉成文字的時候,欄位的順序可能就亂了。掃描檔更麻煩,要先做 OCR,也就是光學文字辨識,模糊的、手寫的、蓋了章的,都可能辨識錯。

Casper: 比喻?

Max: 影印再影印的傳真。看起來還像,可是數字可能已經糊了。最常見的是合併儲存格跟跨頁的表格,一轉就錯位,外徑對到隔壁那個料號;手寫檢驗表的 7 被辨識成 1。

Casper: 那怎麼辦?

Max: 轉完一定要抽查。表格有一個實用做法:把每一列轉成一句完整的描述,例如「料號 A-1023,外徑多少、公差多少」,這樣切塊的時候不會跟表頭分家。如果表格很大、又要精準查數字,就不要放進 RAG,留在資料庫,第 10 段會講。

【待 Max 補,選填】一句自己遇過的轉檔錯誤;沒有就照上面的通用例子講。

8|權限:在哪一站擋

Casper: 上集花很多時間講權限,今天只問一個技術問題:在生產線的哪一站擋?

Max: 在檢索那一站。系統用提問者的身分,先把他沒權限的塊過濾掉,再去排序、交給模型。所以每一塊都要帶著原文件的權限標籤。不能先給模型看,再叫它保密。

Casper: 比喻?

Max: 圖書館的閉架書庫。館員先看你的借書證,才去書庫拿書;不是把書拿出來放你面前,再叫你不要看。工廠的例子就是:業務看得到型錄,看不到配方跟模具圖面。

9|怎麼評估:一張考卷

Casper: 怎麼知道一套 RAG 做得好不好?

Max: 分開量兩件事。第一是「找對了沒」:該找的那一塊,有沒有排在前幾名。第二是「答對了沒」:答案正確、引用真的支持答案、資料不夠時會說不知道。分開量,才知道要修的是檢索還是生成。

Casper: 題目哪裡來?

Max: 用同事真的問過的問題,每題先標好答案在哪份文件、哪一版。題型分三種:正常題、邊界題,還有陷阱題,就是資料裡根本沒有答案的,例如問一個已經停產型號的替代料。比喻是進料驗收:固定的抽檢標準,每一批都用同一把尺。以後改切塊、換模型、加重排,都用同一張考卷重考。

Casper: 聽起來出題很累。

Max: Roger Lin 有一支影片專門講這種考卷怎麼做。Chroma 的創辦人也建議過,他們是賣向量資料庫的:找一個下午,叫個披薩,大家一起手寫題目跟答案,一個下午就有第一版。

10|什麼時候不該用 RAG

Casper: 最後,哪些情況不該用 RAG?

Max: 我列五個。第一,精準的數字跟表格查詢,像 BOM、庫存、價格表。放在資料庫,讓 AI 下查詢語法去查,比切成文件準。但要只給唯讀權限,公司內部的指標定義也要先統一;AI幫手頻道整理過一串 Reddit 討論,講的就是這個風險。

第二,計算跟流程。RAG 找得到報價規則,可是算價、做報價單、追蹤,是一條流程,要靠自動化。第三,排程,那是 APS 或 ERP 的事,不是生成式 AI。第四,文件很少、很短,直接整份放進提示就好,不用建索引。第五,不能外流的機密,就是不放,或改用地端。

Casper: 比喻收一下?

Max: 螺絲起子很好用,但不能拿來鎖六角螺帽。

11|收尾、教同事的三個小技巧、CTA

Casper: 幫大家整理一下。RAG 是一條生產線:切塊、轉向量、檢索、重排、組裝提示、生成、附引用。答案品質由最弱的那一站決定。Max,如果聽眾要回公司教同事,給三個小技巧?

Max: 第一,先示範同一個問題,有掛知識庫跟沒掛的差別。第二,讓大家養成點引用回原文的習慣。第三,動手做一個查規格的小助理,用十題考卷驗收,從考卷看是哪一站出問題。

Casper: 如果你們公司也在做 AI 知識庫,歡迎留言告訴我們,最常卡在哪一站。也歡迎訂閱企業 AI 落地研究所,我們下集見。