你看到AI拿到一張科學成績單,可能先看分數高不高。這種電腦工具會用資料回答問題,可是分數不能單獨看。要判斷它會不會做研究,還得看考了什麼、誰在評分。
這次設計測試的OpenAI,是一家開發AI的公司。它把這套生命科學考卷取名為LifeSciBench。
先跟著一題走進考場
想像科學家把一張實驗圖交給AI。AI要找出證據、說明答案,還要講清楚理由。
生命科學研究生物、人體和疾病。題目有時也請AI設計實驗,或判斷互相衝突的資料。
OpenAI找173位有博士級訓練的科學家,共寫750個任務。若平均分,每位科學家大約負責4題。
博士級訓練表示他們在大學後,又花多年學習怎麼研究。他們也曾在研究生物技術或製作藥物的公司工作。
每題附一張評分表,像老師批改報告時用的檢查清單。答案要包含指定的事實、計算和理由,才能拿到分數。
每題拿到至少70%的分數,才算通過。就像100分的作業要拿70分,才過這一題。
36.1%不是每題只得36分
OpenAI讓自家的生命科學AI GPT-Rosalind來作答。它通過36.1%的任務,是這次最高成績。
換成100個任務,它大約通過36個。較早的OpenAI工具GPT-5.5,則通過約26個。
所以36.1%不是每個答案都拿36.1分。它是在數750個任務中,有多少題拿到至少70分。
AI讀一張圖,成績就往下掉
研究現場的資料,常不是整齊的一段文字。科學家也會查看圖表、網頁和電腦檔案。
例如,有些序列檔記著基因資料的排列。AI得先從很大的檔案找對資料,才能回答。
只看文字時,GPT-Rosalind每100題約通過45題。遇到圖表、檔案或網頁後,只通過約28題。
前後少了17題。這表示它能寫出順暢的說明,卻可能看錯研究材料。
科學家因此要回頭核對原始圖表和檔案。答案讀起來很順,仍不代表內容一定正確。
考卷有人檢查,成績仍要再比
OpenAI另外找453位未參與出題的專家檢查題目。人數比173位出題者多一倍以上。
他們會看題目是否像真實研究,也會看題目有沒有清楚可靠的根據。
這些專家替題目多做一次檢查。但是測試仍由OpenAI設計,結果也由它公布。
這不代表數字造假。但是讀者仍要找其他研究團隊做的測試,互相比較。
公開頁面也沒有列出人類研究員的成績。所以我們不知道36.1%和科學家的表現差多少。
OpenAI也提醒,這套考卷不能代替真實研究。研究會反覆做實驗,也會隨新證據修改答案。
下次看到AI排名,先問三件事
第一,題目像不像真實工作?LifeSciBench放進圖表和檔案,比只問課本內容更接近研究。
第二,分數怎麼算?這次要單題拿到70分,才算一題通過。
第三,誰出題、誰評分、誰公布結果?同一方做了很多事,就要找別人測過的成績。
36.1%只告訴我們,這個AI在這份考卷上仍漏掉很多要求。它不能證明AI毫無用處,也不能證明AI能取代科學家。
這些資料是從哪裡來的
- Introducing LifeSciBench(OpenAI)