你把整份報告交給AI,是想請它比較前後內容。這種電腦工具能照問題產生回答,可是仍可能漏看中間的線索。
電腦明明收到了整份資料,為什麼還會漏掉答案?三份測試放在一起看,放得下和讀得好是兩回事。
一份報告怎麼放進AI
先想像你要找一份報告裡的答案。AI收到文字後,會先切成較小單位,這種單位叫做token。
一個token可能是一個字,也可能只是字的一部分。電腦用token的數量,計算這次收到多少內容。
AI一次能收下的文字範圍,叫做「脈絡視窗」。如果視窗比較大,同一回就能放進更多token。
例如,32K大約代表3萬2千個token。K代表1,000,所以32K就是32個1,000。
研究人員把長文變成考題
可是,報告裝得進視窗,AI不一定每段都用得好。研究人員因此設計RULER,這是一套測試AI讀長文能力的考題。
題目要AI找資料、追蹤線索,還要把幾個答案放在一起。這比只找一個藏起來的詞更難。
RULER用13種任務測試17個長文模型。這些模型都標示至少能收下32K,可是只有一半在32K仍達標。
這就像讓17位AI讀者,各自考13種題目。能收下整張考卷,不代表每一題都答得好。
答案藏在中間,為什麼更容易漏
接著,另一組研究人員把答案換到長文的不同位置。他們也讓AI讀多份文件,再回答問題。
答案放在開頭或結尾時,AI通常答得比較好。但是,答案移到中間,表現可能明顯下降。
研究人員把這個現象叫做Lost in the Middle,意思是「在中間迷路」。就像答案夾在厚講義中間,翻過頭就可能錯過。
所以,把每份文件都塞進去,不一定比較準。資料越多,中間的線索也可能越難被AI用上。
有些問題真的需要看完整份資料
回到你手上的報告。如果你要比較開頭和結尾,AI就需要同時看到前後內容。
程式設計也有相似情況。一個檔案的改動可能影響另一個檔案,所以AI常要一起看幾個檔案。
這些問題都要保留前後關係,不能只找一小段。但是,實際使用前,還是要用自己的題目測試。
只想找幾段答案,可以先搜尋
現在換一個問題:你只想從很多文件裡找出兩三段答案。這時,把全部文件交給AI,可能讓它更難抓到重點。
電腦可以先搜尋,把最相關的段落挑出來。接著,再讓AI只讀這些段落並回答。
這個方法叫做RAG,意思是先找資料,再請AI回答。因為AI收到的內容較少,中間不相關的文字也較少。
Databricks這家公司用13個模型做了超過2,000次測試。放進更多資料有時有幫助,不過多數模型過了某個長度後,表現反而下降。
2,000次等於每天測一次,也要超過五年。這些結果說明,塞進更多文字不一定更好。
先問:要讀完,還是要找出來
現在,你可以先看問題需要哪種讀法。如果要比較同一份長文的前後內容,可以測試較大的視窗。
如果只要從許多文件找幾段答案,可以先用RAG。電腦找出相關資料後,再讓AI比較和回答。
兩種方法也可以放在一起。但是,無論用哪一種,都要回頭查看AI用到的原文。
能讀很多字,只表示AI收得到那些字。它有沒有真的找到答案,仍要由人檢查。