AI+數學
數學問題在 Agent 實踐中的難點
結合 First Proof、Momus、LeanMarathon、Danus 與 Aletheia 等案例,分析數學 Agent 在路線選擇、依賴管理、長證明和失敗資訊保留上的核心難點。
AI for Math · Math Agent · Multi Agent · Formal Reasoning · Proof Verification · 約 17 分鐘 ·
閱讀文章AI+數學
結合 First Proof、Momus、LeanMarathon、Danus 與 Aletheia 等案例,分析數學 Agent 在路線選擇、依賴管理、長證明和失敗資訊保留上的核心難點。
AI for Math · Math Agent · Multi Agent · Formal Reasoning · Proof Verification · 約 17 分鐘 ·
閱讀文章Agent 工程
面向 Agent、Skill、MCP、AI 程式設計與模型 API 的成本最佳化指南:從任務成本核算、上下文管理、快取、工具裁剪到模型選擇與停止條件。
LLM Engineering · Agent Efficiency · Context Engineering · LLM Cost · Model Routing · 約 15 分鐘 ·
閱讀文章Agent 工程
從任務拆分、共享脈絡、重複勞動到 Agent 辯論,復盤 Multi-Agent 系統在真實實踐中最常見的七類失敗模式,以及更可靠的工程判斷。
Multi Agent · Agent Orchestration · Agent Reliability · Context Engineering · Agent Evaluation · 約 15 分鐘 ·
閱讀文章Agent 工程
2026 年的 AI 學習路徑不該只是一張工具清單。本文提出發現、定義、建模、調度、驗證與交付六項能力,說明如何在 AI 時代把想法推進成真實結果。
AI Learning · Agent Workflow · Education AI · Career Skills · Personal Productivity · 約 12 分鐘 ·
閱讀文章Agent 工程
2026 年 AI 識別驗證碼到了什麼水平?本文從文字、九宮格、滑塊到 GUI Agent,分析 CAPTCHA 破解能力、端到端通過率與現代風控系統的變化。
Agent Engineering · GUI Agent · AI Security · Computer Vision · CAPTCHA · 約 25 分鐘 ·
閱讀文章Agent 工程
深入解讀 Google ScientistOne 與 Chain-of-Evidence(CoE)框架,理解 AI 自動研究如何透過聲明分類、證據溯源與完整性稽核,從生成答案走向驗證答案。
Agent Engineering · Autonomous Research · Agent Evaluation · Verifiable AI · ScientistOne · 約 11 分鐘 ·
閱讀文章Agent 工程
從完成條件、代理指標、誤差放大、上下文腐化、工程生產力與安全權限出發,分析 Loop Engineering 為什麼難以成為穩定、普適的軟體工程範式。
Agent Harness · Coding Agent · Agent Reliability · Agent Loop · Loop Engineering · 約 15 分鐘 ·
閱讀文章Agent 工程
Loopcraft 深度解析:為什麼 AI Agent 工程正在從單次 Prompt 優化,轉向任務觸發、驗證、重試、狀態保存和持續改進的 Agent Loop 系統設計。
Agent Harness · Coding Agent · Agent Orchestration · Agent Loop · Prompt Engineering · Loopcraft · 約 15 分鐘 ·
閱讀文章Agent 工程
從一個客服工單的真實場景出發,拆解 Agentic RAG 的編排、查詢改寫、並行檢索、充足性判斷和綜合生成五個環節,分析跨系統權限邊界處理,以及路由策略、迭代深度、延遲權衡三個工程決策點。
Agent Engineering · Agent Orchestration · Retrieval · Enterprise AI · Agentic RAG · 約 15 分鐘 ·
閱讀文章Agent 工程
從 Anthropic Claude Code 三個生產事故復盤出發,分析 reasoning history、system prompt、快取、預設推理強度和真實生產測試對 AI Agent 工程的影響。
Coding Agent · Agent Harness · Agent Reliability · Context Engineering · Claude Code · 約 10 分鐘 ·
閱讀文章AI+數學
拆解 DeepMind AlphaProof Nexus 如何把 LLM、Lean、AlphaProof、演化搜尋和多 Agent 編排組合成面向數學研究的形式化證明系統。
AI for Math · Formal Reasoning · Multi Agent · AlphaProof · Deepmind · 約 17 分鐘 ·
閱讀文章Agent 工程
借 LangChain Runtime 的設計,拆解業務級 Agent 的 Durable Execution、狀態分層、Human-in-the-loop、權限模型、Middleware、Streaming、Observability 與運維擴展,給出一份可直接落地的 Agent Runtime 設計清單。
Agent Harness · Agent Runtime · Agent Reliability · Agent Observability · LangChain · 約 27 分鐘 ·
閱讀文章Agent 工程
拆解 Anthropic Managed Agents 的 Session、Harness、Sandbox、Credential、Context Builder、Trace 與 Eval,說明 Agent Harness 如何演進為生產級 AI Agent Runtime。
Agent Harness · Agent Runtime · Agent Reliability · Anthropic · Managed Agents · 約 18 分鐘 ·
閱讀文章Agent 工程
AHE 論文深度解析,介紹 coding agent harness 如何透過可觀測性、檔案化改動、評測和回滾實現自動演化。
Agent Harness · Coding Agent · Agent Evaluation · Agent Observability · AHE · 約 23 分鐘 ·
閱讀文章Agent 工程
面向中文開發者拆解 DSPy 的 Signature、Module 與 Optimizer,說明為什麼 DSPy 比直接寫 Prompt 更容易做自動優化,適合關注提示詞工程、LLM 工作流程、AI 內容生成與教育 AI 的團隊。
LLM Engineering · Prompt Engineering · LLM Evaluation · DSPy · LLM Pipeline · 約 11 分鐘 ·
閱讀文章Agent 工程
拆解 PaperBanana 的 Retriever、Planner、Stylist、Visualizer 與 Critic 五個 Agent,系統梳理 AI 如何協作生成學術方法圖,適合關注論文配圖、學術寫作與科研工作流的繁中讀者。
Multi Agent · Agent Orchestration · Academic Figures · Agent Workflow · PaperBanana · 約 8 分鐘 ·
閱讀文章Agent 工程
拆解 PaperBanana 學術繪圖流程中的多 Agent 分工機制,聚焦 Retriever、Planner、Stylist、Visualizer 與 Critic 如何協作生成論文方法圖。
Multi Agent · Agent Orchestration · Academic Figures · Role Design · PaperBanana · 約 5 分鐘 ·
閱讀文章AI+數學
系統拆解 AlphaGeometry DSL 的問題格式、defs.txt action 定義、predicate 語義、rules.txt 推理規則與構造流程,適合用於幾何求解器、資料生成與 AlphaGeometry 復現。
AI for Math · Geometry Reasoning · Formal Reasoning · Geometry DSL · AlphaGeometry · 約 10 分鐘 ·
閱讀文章AI+數學
拆解 AlphaGeometry2 如何把幾何推理、輔助線搜尋與符號證明結合起來解決 IMO 幾何題,並整理對數學 AI 工程的啟發。
AI for Math · Geometry Reasoning · Formal Reasoning · AlphaGeometry · Deepmind · 約 10 分鐘 ·
閱讀文章AI+數學
從 AlphaGo 到 AlphaGeometry、AlphaProof,再到 Aletheia,拆解可驗證數學研究閉環的工程價值。
AI for Math · Autonomous Research · Formal Reasoning · Math Agent · Deepmind · 約 11 分鐘 ·
閱讀文章AI+數學
從可執行繪圖到幾何證明,分析 CodePlot-CoT 的優勢與結構性邊界。
AI for Math · Geometry Reasoning · Visual Reasoning · Code Generation · CodePlot CoT · 約 9 分鐘 ·
閱讀文章AI+數學
從基準可信度、模型能力分層到架構型數學系統,梳理 AI for Math 在 2026 年的關鍵進展與產品機會。
AI for Math · Formal Reasoning · Math Reasoning · AI Benchmark · 約 11 分鐘 ·
閱讀文章