前言
做科研的人都懂,一個圖示從想法到完成,比寫正文還折騰。邏輯結構、數據精確、風格規範,三點缺一不可。單模型生成 AI 往往圖很漂亮但邏輯錯,邏輯對了又不夠美觀,或者比例整個跑掉。
PaperBanana 解決了這個問題,而且效果真的不錯。它做對的核心正是 把任務拆成多個角色,讓 AI 小團隊協作。

傳統 AI 的侷限
很多人以為,用大模型直接生成圖片就行了。但科研圖示不同於普通插畫,它不僅要 準確表達邏輯,還要 保證數據精確,最終還得符合學術期刊審美。
單模型一次搞不定三件事,結果不是圖很漂亮但邏輯全錯,就是邏輯對了但風格土得掉渣,而且基本上數字比例都會整個跑掉。
這就是科研圖示的痛點,也是 PaperBanana 這類技術方案出現的原因。
PaperBanana 的五角色協作
PaperBanana 的設計理念是:把生成任務拆成五個職能,每個角色專注在自己最擅長的事情上,然後協作迭代。
可視化流程圖

1. Retriever — 靈感板
Retriever 會從建立好的參考資料庫中找出最相關的示例。
它關注 視覺結構匹配,確保後續生成有可靠的版面參考。
想像一下,設計師先看模板再開始畫圖,這就是 Retriever 的工作。
2. Planner — 骨架設計師
Planner 是核心大腦。它把論文描述和圖示目標轉化成詳細圖示計畫,包括:
-
圖示元件(節點 / 模組)
-
元件之間的邏輯關係和箭頭方向
-
空間配置建議
-
標籤、註解等
Planner 的核心是替圖示提供骨架,避免生成過程隨意亂畫。
3. Stylist — 美學指導
有了骨架之後,Stylist 來負責顏值。
它會根據參考示例提取顏色、字體、線條粗細和形狀,把 Planner 的輸出優化成符合期刊標準的版本。
NeurIPS、Nature 的圖示風格都不一樣,Stylist 讓生成的圖符合學術規範。
4. Visualizer — 執行者
Visualizer 依照規範化計畫生成圖示:
-
方法圖示 → 用高品質圖像生成模型渲染
-
數據圖表 → 輸出 可重現的 Matplotlib 程式碼
這意味著生成圖示不只好看,還能直接作為科研素材使用,可重現、可修改。
5. Critic — QA / 閉環
Critic 是閉環的關鍵,它會檢查圖示是否忠實反映文本、是否清晰、是否符合風格規範。
如果不滿意,就會提出修改建議,讓 Planner / Visualizer 再迭代。通常 2 到 3 輪就能得到高品質圖示。
為什麼多角色協作有效?
對比單模型端到端生成,PaperBanana 有三大優勢:
-
參考驅動:Retriever 提供結構與風格樣例,讓生成更可靠
-
分工明確:邏輯、風格、渲染分開,避免大模型黑箱生成的混亂
-
閉環自檢:Critic + 迭代,讓圖示品質可控
換句話說,這是 AI 助力科研圖示的一次 流程創新。在實驗中,PaperBanana 在忠實度、可讀性和美觀度上都明顯優於 baseline。
如果你對這個場景的設計感興趣,我整理了整套 Prompt,下方獲取。
延伸價值
這種多角色協作模式,不只適用於學術圖示。
在流程圖、實驗設計圖、教學演示圖、數據可視化自動生成,甚至在程式碼生成、決策規劃等複雜任務中,多 Agent 協作也更可靠。