Agent Harness
拆解上下文、工具、記憶、權限、評測與運行時如何共同決定 Agent 的可靠性。
研究Agent 工程 · AI for Math · 教育 SaaS
長期研究與拆解 Agent 工程,探索 AI 在教育場景中的落地。關注 Agent Harness、LLM 應用工程、AI for Math 與教育 SaaS 產品化實踐。
核心理念
拆解上下文、工具、記憶、權限、評測與運行時如何共同決定 Agent 的可靠性。
研究關注從原型到生產環境的 Agent 架構、可觀測性、成本與工程邊界。
工程把形式推理與 Agent 工程應用到數學學習系統和教育產品化實踐中。
落地AI for Math · Math Agent · Multi Agent · Formal Reasoning · Proof Verification
結合 First Proof、Momus、LeanMarathon、Danus 與 Aletheia 等案例,分析數學 Agent 在路線選擇、依賴管理、長證明和失敗資訊保留上的核心難點。
約 17 分鐘
閱讀LLM Engineering · Agent Efficiency · Context Engineering · LLM Cost · Model Routing
面向 Agent、Skill、MCP、AI 程式設計與模型 API 的成本最佳化指南:從任務成本核算、上下文管理、快取、工具裁剪到模型選擇與停止條件。
約 15 分鐘
閱讀