文章

按主题浏览

AI+数学

数学问题在 Agent 实践中的难点

结合 First Proof、Momus、LeanMarathon、Danus 与 Aletheia 等案例,分析数学 Agent 在路线选择、依赖管理、长证明和失败信息保留上的核心难点。

AI for Math · Math Agent · Multi Agent · Formal Reasoning · Proof Verification · 约 17 分钟 ·

阅读文章

Agent 工程

大模型 Token 与成本优化工程指南

面向 Agent、Skill、MCP、AI 编程与模型 API 的成本优化指南:从任务成本核算、上下文管理、缓存、工具裁剪到模型选择与停止条件。

LLM Engineering · Agent Efficiency · Context Engineering · LLM Cost · Model Routing · 约 15 分钟 ·

阅读文章

Agent 工程

Multi-Agent 实践中的坑坑洼洼

从任务拆分、共享上下文、重复劳动到 Agent 辩论,复盘 Multi-Agent 系统在真实实践中最常见的七类失败模式,以及更可靠的工程判断。

Multi Agent · Agent Orchestration · Agent Reliability · Context Engineering · Agent Evaluation · 约 16 分钟 ·

阅读文章

Agent 工程

AI 时代的个人技能图谱:2026 年如何构建完整能力闭环

2026 年的 AI 学习路径不应只是一张工具清单。本文提出发现、定义、建模、调度、验证、交付六项个人能力,说明如何在 AI 时代把想法推进为真实结果。

AI Learning · Agent Workflow · Education AI · Career Skills · Personal Productivity · 约 14 分钟 ·

阅读文章

Agent 工程

2026 年 AI 能破解验证码吗?从 CAPTCHA 识别到风控系统

2026 年 AI 识别验证码到了什么水平?本文从文字、九宫格、滑块到 GUI Agent,分析 CAPTCHA 破解能力、端到端通过率与现代风控系统的变化。

Agent Engineering · GUI Agent · AI Security · Computer Vision · CAPTCHA · 约 25 分钟 ·

阅读文章

Agent 工程

从生成到验证:Google ScientistOne 的 CoE 证据链框架

深入解读 Google ScientistOne 与 Chain-of-Evidence(CoE)框架,理解 AI 自动研究如何通过声明分类、证据溯源与完整性审计,从生成答案走向验证答案。

Agent Engineering · Autonomous Research · Agent Evaluation · Verifiable AI · ScientistOne · 约 11 分钟 ·

阅读文章

Agent 工程

Loop Engineering 的现实挑战:我为什么不看好循环工程

从完成条件、代理指标、误差放大、上下文腐化、工程生产率与安全权限出发,分析 Loop Engineering 为什么难以成为稳定、普适的软件工程范式。

Agent Harness · Coding Agent · Agent Reliability · Agent Loop · Loop Engineering · 约 16 分钟 ·

阅读文章

Agent 工程

Loopcraft 是什么:从 Prompt Engineering 到 Agent Loop 系统设计

Loopcraft 深度解析:为什么 AI Agent 工程正在从单次 Prompt 优化,转向任务触发、验证、重试、状态保存和持续改进的 Agent Loop 系统设计。

Agent Harness · Coding Agent · Agent Orchestration · Agent Loop · Prompt Engineering · Loopcraft · 约 15 分钟 ·

阅读文章

Agent 工程

实践分享:Agentic RAG 如何应对企业数据的真实混乱

从一个客服工单的真实场景出发,拆解 Agentic RAG 的编排、查询改写、并行检索、充足性判断和综合生成五个环节,分析跨系统权限边界处理,以及路由策略、迭代深度、延迟权衡三个工程决策点。

Agent Engineering · Agent Orchestration · Retrieval · Enterprise AI · Agentic RAG · 约 15 分钟 ·

阅读文章

Agent 工程

Claude Code 翻车复盘:Anthropic 三个生产事故暴露的 Agent 工程问题

从 Anthropic Claude Code 三个生产事故复盘出发,分析 reasoning history、system prompt、缓存、默认推理强度和真实生产测试对 AI Agent 工程的影响。

Coding Agent · Agent Harness · Agent Reliability · Context Engineering · Claude Code · 约 10 分钟 ·

阅读文章

AI+数学

DeepMind AlphaProof Nexus 拆解:AI 数学研究的 4 种系统范式

拆解 DeepMind AlphaProof Nexus 如何把 LLM、Lean、AlphaProof、演化搜索和多 Agent 编排组合成面向数学研究的形式化证明系统。

AI for Math · Formal Reasoning · Multi Agent · AlphaProof · Deepmind · 约 17 分钟 ·

阅读文章

Agent 工程

向 LangChain 学习:如何为业务级 Agent 提供可靠性的运行时

借 LangChain Runtime 的设计,拆解业务级 Agent 的 Durable Execution、状态分层、Human-in-the-loop、权限模型、Middleware、Streaming、Observability 与运维扩展,给出一份可直接落地的 Agent Runtime 设计清单。

Agent Harness · Agent Runtime · Agent Reliability · Agent Observability · LangChain · 约 27 分钟 ·

阅读文章

Agent 工程

Anthropic Managed Agents 架构拆解:2026 Agent Harness 生产化设计

拆解 Anthropic Managed Agents 的 Session、Harness、Sandbox、Credential、Context Builder、Trace 与 Eval,解释 Agent Harness 如何演进为生产级 AI Agent Runtime。

Agent Harness · Agent Runtime · Agent Reliability · Anthropic · Managed Agents · 约 18 分钟 ·

阅读文章

Agent 工程

AHE 深度解析:Coding Agent 的 Harness 如何自动演化

AHE 论文深度解析,介绍 coding agent harness 如何通过可观测性、文件化改动、评测和回滚实现自动演化。

Agent Harness · Coding Agent · Agent Evaluation · Agent Observability · AHE · 约 23 分钟 ·

阅读文章

Agent 工程

DSPy 教程:为什么 Signature 比直接写 Prompt 更容易做自动优化

面向中文开发者拆解 DSPy 的 Signature、Module 与 Optimizer,解释为什么 DSPy 比直接写 Prompt 更容易做自动优化,适合关注提示词工程、LLM 工作流、AI 内容生成与教育 AI 的团队。

LLM Engineering · Prompt Engineering · LLM Evaluation · DSPy · LLM Pipeline · 约 11 分钟 ·

阅读文章

Agent 工程

拆解 PaperBanana:AI 如何协作生成学术方法图

拆解 PaperBanana 的 Retriever、Planner、Stylist、Visualizer 与 Critic 五个 Agent,系统梳理 AI 如何协作生成学术方法图,适合关注论文配图、学术写作与科研工作流的中文读者。

Multi Agent · Agent Orchestration · Academic Figures · Agent Workflow · PaperBanana · 约 8 分钟 ·

阅读文章

Agent 工程

如何通过多 Agent 分工完成学术绘图?机制拆解

拆解 PaperBanana 学术绘图流程中的多 Agent 分工机制,聚焦 Retriever、Planner、Stylist、Visualizer 与 Critic 如何协作生成论文方法图。

Multi Agent · Agent Orchestration · Academic Figures · Role Design · PaperBanana · 约 5 分钟 ·

阅读文章

AI+数学

AlphaGeometry DSL 教程:Google 几何构造语言、defs.txt 与 Predicate 详解

系统拆解 AlphaGeometry DSL 的问题格式、defs.txt action 定义、predicate 语义、rules.txt 推理规则与构造流程,适合做几何求解器、数据生成与 AlphaGeometry 复现。

AI for Math · Geometry Reasoning · Formal Reasoning · Geometry DSL · AlphaGeometry · 约 10 分钟 ·

阅读文章

AI+数学

AlphaGeometry2 深度解析:Google AI 如何解决 IMO 几何题?

拆解 AlphaGeometry2 如何把几何推理、辅助线搜索与符号证明结合起来解决 IMO 几何题,并总结对数学 AI 工程的启发。

AI for Math · Geometry Reasoning · Formal Reasoning · AlphaGeometry · Deepmind · 约 10 分钟 ·

阅读文章

AI+数学

Google DeepMind Aletheia:完全自主研究的数学 Agent 解读

从 AlphaGo 到 AlphaGeometry、AlphaProof,再到 Aletheia,拆解可验证数学研究闭环的工程价值。

AI for Math · Autonomous Research · Formal Reasoning · Math Agent · Deepmind · 约 11 分钟 ·

阅读文章

AI+数学

HKU CodePlot-CoT 深度解析:视觉推理还是几何推理?

从可执行绘图到几何证明,分析 CodePlot-CoT 的优势与结构性边界。

AI for Math · Geometry Reasoning · Visual Reasoning · Code Generation · CodePlot CoT · 约 9 分钟 ·

阅读文章

AI+数学

AI 与数学的融合:技术路径、应用前沿与未来展望(2026 版)

从基准可信度、模型能力分层到架构型数学系统,梳理 AI for Math 在 2026 年的关键进展与产品机会。

AI for Math · Formal Reasoning · Math Reasoning · AI Benchmark · 约 11 分钟 ·

阅读文章