AI+数学
数学问题在 Agent 实践中的难点
结合 First Proof、Momus、LeanMarathon、Danus 与 Aletheia 等案例,分析数学 Agent 在路线选择、依赖管理、长证明和失败信息保留上的核心难点。
AI for Math · Math Agent · Multi Agent · Formal Reasoning · Proof Verification · 约 17 分钟 ·
阅读文章AI+数学
结合 First Proof、Momus、LeanMarathon、Danus 与 Aletheia 等案例,分析数学 Agent 在路线选择、依赖管理、长证明和失败信息保留上的核心难点。
AI for Math · Math Agent · Multi Agent · Formal Reasoning · Proof Verification · 约 17 分钟 ·
阅读文章Agent 工程
面向 Agent、Skill、MCP、AI 编程与模型 API 的成本优化指南:从任务成本核算、上下文管理、缓存、工具裁剪到模型选择与停止条件。
LLM Engineering · Agent Efficiency · Context Engineering · LLM Cost · Model Routing · 约 15 分钟 ·
阅读文章Agent 工程
从任务拆分、共享上下文、重复劳动到 Agent 辩论,复盘 Multi-Agent 系统在真实实践中最常见的七类失败模式,以及更可靠的工程判断。
Multi Agent · Agent Orchestration · Agent Reliability · Context Engineering · Agent Evaluation · 约 16 分钟 ·
阅读文章Agent 工程
2026 年的 AI 学习路径不应只是一张工具清单。本文提出发现、定义、建模、调度、验证、交付六项个人能力,说明如何在 AI 时代把想法推进为真实结果。
AI Learning · Agent Workflow · Education AI · Career Skills · Personal Productivity · 约 14 分钟 ·
阅读文章Agent 工程
2026 年 AI 识别验证码到了什么水平?本文从文字、九宫格、滑块到 GUI Agent,分析 CAPTCHA 破解能力、端到端通过率与现代风控系统的变化。
Agent Engineering · GUI Agent · AI Security · Computer Vision · CAPTCHA · 约 25 分钟 ·
阅读文章Agent 工程
深入解读 Google ScientistOne 与 Chain-of-Evidence(CoE)框架,理解 AI 自动研究如何通过声明分类、证据溯源与完整性审计,从生成答案走向验证答案。
Agent Engineering · Autonomous Research · Agent Evaluation · Verifiable AI · ScientistOne · 约 11 分钟 ·
阅读文章Agent 工程
从完成条件、代理指标、误差放大、上下文腐化、工程生产率与安全权限出发,分析 Loop Engineering 为什么难以成为稳定、普适的软件工程范式。
Agent Harness · Coding Agent · Agent Reliability · Agent Loop · Loop Engineering · 约 16 分钟 ·
阅读文章Agent 工程
Loopcraft 深度解析:为什么 AI Agent 工程正在从单次 Prompt 优化,转向任务触发、验证、重试、状态保存和持续改进的 Agent Loop 系统设计。
Agent Harness · Coding Agent · Agent Orchestration · Agent Loop · Prompt Engineering · Loopcraft · 约 15 分钟 ·
阅读文章Agent 工程
从一个客服工单的真实场景出发,拆解 Agentic RAG 的编排、查询改写、并行检索、充足性判断和综合生成五个环节,分析跨系统权限边界处理,以及路由策略、迭代深度、延迟权衡三个工程决策点。
Agent Engineering · Agent Orchestration · Retrieval · Enterprise AI · Agentic RAG · 约 15 分钟 ·
阅读文章Agent 工程
从 Anthropic Claude Code 三个生产事故复盘出发,分析 reasoning history、system prompt、缓存、默认推理强度和真实生产测试对 AI Agent 工程的影响。
Coding Agent · Agent Harness · Agent Reliability · Context Engineering · Claude Code · 约 10 分钟 ·
阅读文章AI+数学
拆解 DeepMind AlphaProof Nexus 如何把 LLM、Lean、AlphaProof、演化搜索和多 Agent 编排组合成面向数学研究的形式化证明系统。
AI for Math · Formal Reasoning · Multi Agent · AlphaProof · Deepmind · 约 17 分钟 ·
阅读文章Agent 工程
借 LangChain Runtime 的设计,拆解业务级 Agent 的 Durable Execution、状态分层、Human-in-the-loop、权限模型、Middleware、Streaming、Observability 与运维扩展,给出一份可直接落地的 Agent Runtime 设计清单。
Agent Harness · Agent Runtime · Agent Reliability · Agent Observability · LangChain · 约 27 分钟 ·
阅读文章Agent 工程
拆解 Anthropic Managed Agents 的 Session、Harness、Sandbox、Credential、Context Builder、Trace 与 Eval,解释 Agent Harness 如何演进为生产级 AI Agent Runtime。
Agent Harness · Agent Runtime · Agent Reliability · Anthropic · Managed Agents · 约 18 分钟 ·
阅读文章Agent 工程
AHE 论文深度解析,介绍 coding agent harness 如何通过可观测性、文件化改动、评测和回滚实现自动演化。
Agent Harness · Coding Agent · Agent Evaluation · Agent Observability · AHE · 约 23 分钟 ·
阅读文章Agent 工程
面向中文开发者拆解 DSPy 的 Signature、Module 与 Optimizer,解释为什么 DSPy 比直接写 Prompt 更容易做自动优化,适合关注提示词工程、LLM 工作流、AI 内容生成与教育 AI 的团队。
LLM Engineering · Prompt Engineering · LLM Evaluation · DSPy · LLM Pipeline · 约 11 分钟 ·
阅读文章Agent 工程
拆解 PaperBanana 的 Retriever、Planner、Stylist、Visualizer 与 Critic 五个 Agent,系统梳理 AI 如何协作生成学术方法图,适合关注论文配图、学术写作与科研工作流的中文读者。
Multi Agent · Agent Orchestration · Academic Figures · Agent Workflow · PaperBanana · 约 8 分钟 ·
阅读文章Agent 工程
拆解 PaperBanana 学术绘图流程中的多 Agent 分工机制,聚焦 Retriever、Planner、Stylist、Visualizer 与 Critic 如何协作生成论文方法图。
Multi Agent · Agent Orchestration · Academic Figures · Role Design · PaperBanana · 约 5 分钟 ·
阅读文章AI+数学
系统拆解 AlphaGeometry DSL 的问题格式、defs.txt action 定义、predicate 语义、rules.txt 推理规则与构造流程,适合做几何求解器、数据生成与 AlphaGeometry 复现。
AI for Math · Geometry Reasoning · Formal Reasoning · Geometry DSL · AlphaGeometry · 约 10 分钟 ·
阅读文章AI+数学
拆解 AlphaGeometry2 如何把几何推理、辅助线搜索与符号证明结合起来解决 IMO 几何题,并总结对数学 AI 工程的启发。
AI for Math · Geometry Reasoning · Formal Reasoning · AlphaGeometry · Deepmind · 约 10 分钟 ·
阅读文章AI+数学
从 AlphaGo 到 AlphaGeometry、AlphaProof,再到 Aletheia,拆解可验证数学研究闭环的工程价值。
AI for Math · Autonomous Research · Formal Reasoning · Math Agent · Deepmind · 约 11 分钟 ·
阅读文章AI+数学
从可执行绘图到几何证明,分析 CodePlot-CoT 的优势与结构性边界。
AI for Math · Geometry Reasoning · Visual Reasoning · Code Generation · CodePlot CoT · 约 9 分钟 ·
阅读文章AI+数学
从基准可信度、模型能力分层到架构型数学系统,梳理 AI for Math 在 2026 年的关键进展与产品机会。
AI for Math · Formal Reasoning · Math Reasoning · AI Benchmark · 约 11 分钟 ·
阅读文章