如何透過多 Agent 分工完成學術繪圖?機制拆解

主題: Agent 工程

發布日期:

最後修改:

前言

做科研的人都懂,一個圖示從想法到完成,比寫正文還折騰。邏輯結構、數據精確、風格規範,三點缺一不可。單模型生成 AI 往往圖很漂亮但邏輯錯,邏輯對了又不夠美觀,或者比例整個跑掉。

PaperBanana 解決了這個問題,而且效果真的不錯。它做對的核心正是 把任務拆成多個角色,讓 AI 小團隊協作。

image.png

傳統 AI 的侷限

很多人以為,用大模型直接生成圖片就行了。但科研圖示不同於普通插畫,它不僅要 準確表達邏輯,還要 保證數據精確,最終還得符合學術期刊審美。

單模型一次搞不定三件事,結果不是圖很漂亮但邏輯全錯,就是邏輯對了但風格土得掉渣,而且基本上數字比例都會整個跑掉。

這就是科研圖示的痛點,也是 PaperBanana 這類技術方案出現的原因。

PaperBanana 的五角色協作

PaperBanana 的設計理念是:把生成任務拆成五個職能,每個角色專注在自己最擅長的事情上,然後協作迭代。

可視化流程圖

image.png

1. Retriever — 靈感板

Retriever 會從建立好的參考資料庫中找出最相關的示例。

它關注 視覺結構匹配,確保後續生成有可靠的版面參考。

想像一下,設計師先看模板再開始畫圖,這就是 Retriever 的工作。

2. Planner — 骨架設計師

Planner 是核心大腦。它把論文描述和圖示目標轉化成詳細圖示計畫,包括:

  • 圖示元件(節點 / 模組)

  • 元件之間的邏輯關係和箭頭方向

  • 空間配置建議

  • 標籤、註解等

Planner 的核心是替圖示提供骨架,避免生成過程隨意亂畫。

3. Stylist — 美學指導

有了骨架之後,Stylist 來負責顏值。

它會根據參考示例提取顏色、字體、線條粗細和形狀,把 Planner 的輸出優化成符合期刊標準的版本。

NeurIPS、Nature 的圖示風格都不一樣,Stylist 讓生成的圖符合學術規範。

4. Visualizer — 執行者

Visualizer 依照規範化計畫生成圖示:

  • 方法圖示 → 用高品質圖像生成模型渲染

  • 數據圖表 → 輸出 可重現的 Matplotlib 程式碼

這意味著生成圖示不只好看,還能直接作為科研素材使用,可重現、可修改。

5. Critic — QA / 閉環

Critic 是閉環的關鍵,它會檢查圖示是否忠實反映文本、是否清晰、是否符合風格規範。

如果不滿意,就會提出修改建議,讓 Planner / Visualizer 再迭代。通常 2 到 3 輪就能得到高品質圖示。

為什麼多角色協作有效?

對比單模型端到端生成,PaperBanana 有三大優勢:

  1. 參考驅動:Retriever 提供結構與風格樣例,讓生成更可靠

  2. 分工明確:邏輯、風格、渲染分開,避免大模型黑箱生成的混亂

  3. 閉環自檢:Critic + 迭代,讓圖示品質可控

換句話說,這是 AI 助力科研圖示的一次 流程創新。在實驗中,PaperBanana 在忠實度、可讀性和美觀度上都明顯優於 baseline。

如果你對這個場景的設計感興趣,我整理了整套 Prompt,下方獲取。

延伸價值

這種多角色協作模式,不只適用於學術圖示。

在流程圖、實驗設計圖、教學演示圖、數據可視化自動生成,甚至在程式碼生成、決策規劃等複雜任務中,多 Agent 協作也更可靠。

參考資料