很多人第一個會想到,近千個 Claude 代理是不是就能更快找到答案。要判斷多代理協作能否用在研究或資料探索,得先分清楚代理找到了什麼、研究人員又完成了哪些工作。

Anthropic 表示,研究團隊讓約 950 個 Claude 代理搜尋 DNA 資料約 21 小時,找到一組帶有重複 DNA 序列的逆轉錄酶系統,再由研究者接手分析與實驗。這項早期成果值得看的地方,是搜尋線索如何形成、如何驗證,以及代理數量本身不能證明什麼。

一、Claude 找到的 ART 是什麼?

ART 是研究團隊對「陣列相關逆轉錄酶系統」的命名,由逆轉錄酶、鄰近的伴隨蛋白基因,以及一段重複 DNA 序列構成;目前主要功能仍未確定。

逆轉錄酶(reverse transcriptase,RT)是一類能以 RNA 為模板合成 DNA 的酵素。Anthropic 的研究團隊表示,這次相關的 RT 家族早已在先前研究中被辨識,新的觀察是它旁邊還有一個伴隨基因,以及一段長而規律的非編碼 DNA 重複序列。研究者把這組特徵合稱 ART,並在噬菌體,也就是感染細菌的病毒中找到相關案例。

重複序列的排列方式讓研究者想到 CRISPR。CRISPR 系統含有重複序列與間隔序列,相關 RNA 可參與辨識目標;Anthropic 表示,初步實驗觀察到 ART 的重複序列會表現成多種短 RNA。這只能說明兩者在某些結構特徵上有相似處,不能據此推論 ART 也會像 CRISPR 一樣辨識目標、切割 DNA,或具有可程式化的基因編輯能力。

研究找到的是一組先前未被描述在一起的生物學特徵,團隊正追查它們是否共同構成一套功能系統。短 RNA 的存在是實驗觀察,ART 如何運作仍待研究。公告指出其主要功能尚未確定,也沒有足夠證據把它說成基因編輯工具,或判定伴隨蛋白與 RNA 各自的作用。

「雖然我們還不知道它的功能,但 Claude 找到的系統具有一組特徵,這些特徵過去只曾一起出現在少數系統中。」(依 Anthropic 研究團隊公告翻譯)

「發現值得追查的候選系統」和「已弄清楚它的功能」是兩個階段。前者是研究進展,後者仍需要生化、結構與功能實驗。相似的 DNA 圖樣能帶出假設,不能單獨替假設背書。

二、近千個代理如何從資料庫走到候選線索?

研究者先設定搜尋逆轉錄酶的方向,Claude 代理再搜尋與整理候選、比較家族並產出報告;人工研究者審閱線索,之後才進行實驗。

依 Anthropic 說明,研究團隊先設定搜尋方向,從大量 DNA 序列中尋找新的 RT 案例。代理約 21 小時蒐集超過 20 萬個 RT,整理出約 3,500 個候選,再縮小到 20 個深入分析並撰寫報告。公告以約 950 個代理與 2.1 億 tokens 描述搜尋規模;這些數字反映運算投入,不能代表正確率或研究品質。

流程分工明確:代理探索資料、比較候選、搜尋文獻和整理證據;研究人員設定方向、審閱候選並完成實驗。Anthropic 表示所有實驗室工作由人類執行。代理協助擴大計算搜尋,專家再篩選和驗證,模型沒有獨自完成從研究問題到實驗結論的整條流程。

流程圖由左至右呈現研究者設定問題、代理搜尋資料、專家審閱候選,以及實驗室人員驗證候選。
代理協助擴大搜尋範圍,研究者仍負責審閱線索與實驗驗證。

引人注意的轉折發生在候選追查階段。一個代理在檢視某個 RT 附近的原始 DNA 序列時,注意到一段規律重複的序列。接著它計算重複單位與間距,和已知 RT 系統比較,並查找文獻是否記載過相同排列,最後才把候選整理成報告交給研究者審查。搜尋路徑從資料索引回到具體序列,代理再提出可供檢視的異常線索。

「代理完成任務」不等於「研究完成」。搜尋提供候選空間,序列檢視讓異常浮現,文獻查詢協助確認是否已有描述,實驗則回答部分生物學問題。各階段應分別保存輸入、方法和結果,才能回溯候選保留或排除的理由。

三、為什麼多代理可能看見單一路徑漏掉的模式?

把大量候選分派給多個代理,可能擴大同時探索的範圍;這次的關鍵線索則出現在一個候選 RT 周邊的原始序列。搜尋廣度與線索辨識都依賴任務設計和可檢查的資料。

人工研究者面對海量序列時,通常先依既有知識設定搜尋條件,再逐步縮小範圍。這種方式有效率,但容易受限於研究者預先設想的特徵:若搜尋只問「有哪些類似已知家族的酵素」,就可能不會特別查看旁邊的非編碼序列。這次的描述指出,代理在追查 RT 候選時,注意到鄰近 DNA 有規律的重複排列,讓研究問題從「這是什麼 RT」擴展到「這個 RT 附近是否有一套尚未描述的系統」。

多代理可能讓不同搜尋路徑平行展開,加快候選整理。關鍵在於資料是否可用、分析步驟能否追蹤、輸出能否複核。若欄位混亂、序列無法取回,或任務只鼓勵新奇結論,增加代理可能只會帶來重複候選和複核負擔。

「為什麼這條線索之前沒被報告?」也要謹慎回答。Anthropic 的公告稱,RT 本身曾在前人研究中被辨識,但伴隨基因與重複序列的組合此前未被注意。這是研究團隊對目前文獻的描述,不表示相關區域從未被任何研究者或分析工具看過,更不能證明是 AI 單獨完成了全部發現。代理可以在研究者指定的範圍中帶出意外觀察,這項觀察仍要放回既有資料、文獻和生物學脈絡中確認。

大量掃描能縮小候選範圍,但也可能帶來錯誤命中、資料缺漏和重複紀錄。專家仍須檢查序列完整度、基因註解、跨資料庫樣本對應和資料偏差。只報代理數或 token 數,沒有篩選條件與排除理由,讀者就無從判斷搜尋覆蓋範圍。

「Claude 產生假設的速度很快,因此這些假設本身也成為我們研究的對象。」(依 Anthropic 研究團隊公告翻譯)

Anthropic 團隊表示,他們會觀察哪些候選值得實驗、哪些應該排除,再把學到的判準回饋到代理指令。這反映出一個重要的系統設計問題:代理產出速度若高於專家驗證速度,瓶頸就會從搜尋轉移到排序、審查和實驗排程。流程能否改善,取決於團隊是否把「什麼線索值得追」變成明確、可檢查的判準,而非只追求產出更多報告。

四、要怎麼查核代理提出的研究證據?

把序列觀察、研究者解讀、實驗結果與功能假設分開記錄;每個對外主張都回到原始資料、文獻或實驗結果,確認證據能支持到哪一層。

第一層是資料觀察:原始序列有沒有重複單位、間距是否規律、附近是否有 RT 與伴隨基因。應提供資料庫紀錄、序列範圍、分析版本和檢查方法,讓他人找到相同片段。序列組裝、基因預測或資料更新都可能影響結果,必須保留資料版本與篩選條件。

第二層是解讀:研究者如何把這些片段歸納成 ART 候選系統,為何認為它和既有 RT 家族不同,以及重複序列與伴隨基因可能代表什麼。這些都是根據資料提出的分類和解釋,應清楚標成推論,列出支持線索與仍可有其他解釋的地方。若模型只給出結論,沒有說明它比較過哪些已知家族、檢索過哪些文獻,審查者便很難分辨新發現和既有知識的重新組合。

第三層是實驗結果。Anthropic 表示,初步實驗觀察到 ART 重複序列會表現為多種短 RNA。這還未解答短 RNA 是否參與 RT 活性、伴隨蛋白的作用,或系統如何運作。應分開描述實際量到的現象和作者對生物學意義的解釋,不能把「觀察到 RNA」寫成「已證明 RNA 導引酵素執行特定功能」。

第四層才是功能推論與應用想像。ART 有重複序列,外觀讓人聯想到 CRISPR;但功能還在研究中,兩者的工作機制並未因此被證明相同。要提出基因編輯或其他應用可能,需要直接的功能實驗,並釐清系統如何辨識目標、如何作用,以及在不同條件下是否可重現。現階段把 ART 說成「類 CRISPR」只能是形態或研究方向的比喻,不能當成已具備 CRISPR 的功能證據。

證據圖分列 DNA 序列觀察、研究者解讀、短 RNA 實驗測量,以及尚未驗證的功能與應用假設,並標出未解問題的界線。
短 RNA 是初步實驗觀察,ART 的功能與應用仍屬待驗證問題。

查核代理研究時,可逐條追問:主張是否能回到具體資料?資料是否由獨立方法確認?研究者的判斷依據是否可重做?實驗測量的是什麼?哪些結論仍是推論?研究團隊是否交代候選被排除的理由?此外,還要確認預印本的狀態與後續獨立驗證情形。預印本能讓社群提早檢視方法與結果,但它本身不等於已通過同儕審查,也不代表其他團隊已獨立重現。

五、哪些研究流程適合重用多代理協作?

當資料可機器讀取、問題能拆成可追蹤步驟、候選可排序,而且有專家與方法能獨立驗證時,多代理較適合協助擴大探索;否則先改善資料與查核流程。

適合先試行的任務有清楚輸入與可回查輸出,例如整理文獻庫候選、比較公開資料集中的特徵,或標出待複核異常。每一步都要能說明資料來源、篩選條件和保留或排除理由,讓代理交付可審查的線索,而非無法追溯的答案。

導入前也得確認資料治理。團隊要知道資料由誰維護、授權允許哪些用途、資料欄位與版本如何標記,以及代理能否接觸敏感內容。生物序列資料探索還要處理不同資料庫的註解差異、樣本來源、基因組組裝品質與重複紀錄。資料品質沒處理好,代理即使能快速搜尋,最後仍可能把錯誤標籤、缺失紀錄或不相容版本混在一起分析。

可重現性和運作成本也要納入。保留提示、工具與資料版本、候選依據、錯誤紀錄及人工改判原因。模型、資料快照、提示或工具改動都可能改變結果,團隊應先定義比對方式和停止條件。成本還包括專家讀報告、核對資料、安排實驗和維護管線的時間。

規劃時可以先挑一個小而可複核的任務,建立人工基準答案,再比較代理流程能否找回同一批重要候選、是否帶來人工流程未注意的線索、誤判率與複核時間如何變化。評估重點是代理能否在可接受的成本下,增加值得追查且可驗證的候選。確認這個階段有明確收益後,再擴大資料範圍或代理數量,觀察擴張帶來更多探索能力,或增加審查負荷。

對研究團隊而言,ART 案例可供借鏡的是把資料搜尋、線索排序和人類驗證接成一條清楚的流程。對一般企業或研究單位,最穩妥的起點是選資料來源清楚、輸出可回查、專家能複核的小任務,保留每一步的輸入、依據和排除理由,再依實際結果評估是否擴大。單一案例說明一種可能的工作方式,尚不足以證明多代理在其他模型、資料集或研究問題上都同樣有效。

  • 這次代理搜尋帶出 ART 候選系統,ART 的主要功能仍未確定。
  • 代理擴大了資料探索,研究者仍負責問題設定、審閱和實驗驗證。
  • 重用多代理前,先確認資料可回查、步驟可重現、結果有人能獨立檢查。
  1. 選一項資料來源明確、結果可由專家複核的小任務。
  2. 先建立人工基準,定義候選保留與排除的判準。
  3. 記錄資料版本、提示、工具、候選依據、錯誤與人工改判。
  4. 比較可驗證候選的品質、複核時間和總成本,再決定是否擴大。

常見問題

Q1: ART 已證明能像 CRISPR 一樣編輯基因嗎?

沒有。研究團隊表示 ART 的主要功能仍在研究,初步實驗觀察到重複序列會表現為短 RNA;這不足以證明 ART 能辨識目標或執行基因編輯。

Q2: 近 950 個代理代表研究結果已經獨立重現嗎?

不代表。代理數描述這次搜尋的執行規模,獨立重現需要其他研究者使用可查核的方法與資料再次驗證。Anthropic 公告將成果描述為早期研究,並提供預印本供檢視。

Q3: 代理產生的候選能直接當成研究結論嗎?

不能。候選是待審查的線索,仍需回到原始資料和文獻核對,再視研究問題安排實驗。結論的肯定程度應與實際取得的證據相符。