更新于 2026-08-18。 这是一份精选的 AI 工程项目地图,不重复罗列 ChatGPT、Claude、Gemini、Midjourney 等大众化成品模型;重点收录可开发、可部署、可组合的真实项目。筛选优先考虑官方维护、社区采用和实际用途,不按 GitHub Stars 简单排名。文中“开源”也可能分别指源代码开放、开放权重或 source-available,三者不要混为一谈。

AI Agent 终端与应用项目

Chat UI

  • Cherry Studio - 桌面级跨平台 AI 工作台,统一接入云端及本地模型,并集成助手、知识库和 Agent 能力。
  • Lobe Chat - 自部署多模型聊天终端,界面完善,支持插件、知识库和多模态能力。
  • Open WebUI - 可离线运行的自部署 AI 平台,兼容 Ollama 和 OpenAI-compatible API,并提供 RAG、插件、权限与 Agent 能力。

通用智能体

  • OpenClaw - 多渠道个人 AI 助手,可连接消息平台、文件、浏览器和终端,支持本地或托管模型、记忆与 Skills。它拥有真实执行权限,部署时应启用认证、沙箱并审查第三方 Skills。
  • OpenHands - 开源的软件开发 Agent 平台,支持浏览器、终端、代码修改和沙箱执行,适合作为 Devin 类 Agent 的可自托管代表。
  • DeerFlow - 字节跳动开源的长时任务 SuperAgent harness,组合 sub-agents、memory、sandbox、skills 和工具,覆盖调研、编码与内容生成。

面向 AI 的搜索

  • Exa - 面向 LLM 的语义搜索和网页内容 API,适合相似内容发现、研究和 Agent 检索。
  • Tavily - 面向 Agent 的搜索 API,提供搜索、提取、重排和适合上下文注入的结果。
  • Brave Search API - 基于独立搜索索引的搜索 API,可作为 AI 应用的检索后端。
  • Grep.app - 跨百万公开 GitHub 仓库的代码搜索;同时提供 MCP 接口,支持正则、语言、仓库和路径过滤。
  • Context7 - 面向编码 Agent 的版本化文档和代码示例检索服务,减少模型使用过时 API 的问题。

深度研究(Deep Research)

  • GPT Researcher - 可替换模型和搜索后端的开源调研 Agent,支持并行检索、引用和多种报告格式。
  • Open Deep Research - LangChain 的可配置开源深度研究 Agent,支持多模型、搜索工具和 MCP Server。
  • STORM - Stanford OVAL 的知识整理系统,通过多视角提问和检索生成带引用的长文,更偏向研究和写作的预处理阶段。

行业与科研应用

  • OpenBB - 面向金融数据和分析的开源终端,可接入多种数据源与 AI 工作流。

AI 编程助手

AI 原生 IDE

  • Cursor - AI 原生 IDE 的代表,提供代码库索引、Agent、多文件编辑、规则和后台任务。
  • Devin Desktop(原 Windsurf) - Cognition 于 2026 年将 Windsurf 更名后的 IDE,在编辑器基础上加入 Agent Command Center,用于管理本地和云端 Agent。
  • Zed - 原生高性能代码编辑器,集成多种模型和 Agent,适合重视响应速度和本地体验的开发者。
  • Google Antigravity - Google 的 agent-first 开发平台,提供 IDE、并行 Agent、Artifacts 和后台任务能力。
  • Kiro - AWS 的规范驱动(spec-driven)AI IDE,先将需求、设计和任务结构化,再生成和验证实现。

IDE 插件

  • Cline - 开源、模型无关的 IDE/CLI 编程 Agent,可在用户确认后读写文件、执行命令、使用浏览器和 MCP。
  • Tabby - 可自托管的代码补全服务,适合希望控制模型和代码数据流向的团队。

命令行工具(CLI)

  • Claude Code - Anthropic 的终端 Agent,支持代码库理解、文件修改、测试、Git 工作流、Skills 和 MCP。
  • OpenAI Codex CLI - OpenAI 的本地终端编码 Agent,支持代码编辑、命令执行、MCP、图像输入和沙箱权限控制。
  • OpenHands CLI - OpenHands 的终端编码 Agent,支持多模型、代码库操作、终端执行和可插拔沙箱。
  • OpenCode - 开源、模型无关的终端编码 Agent,提供 TUI、plan/build Agent、MCP 和桌面客户端。
  • Pi Coding Agent - 极简、可扩展的终端编码 Agent,核心保持轻量,通过 TypeScript 扩展、Skills、提示模板和 packages 组合出不同工作流。
  • Goose - Block 发起的开源 Agent,强调本地运行、MCP 扩展、工具调用和可审计的开发自动化。
  • Qwen Code - Qwen 生态的开源终端编码 Agent,适合希望搭配开放模型或其他兼容模型的开发者。

Agent 与应用开发平台

低代码 / 可视化平台

  • Dify - 开源 LLM 应用平台,提供可视化 Agent、工作流、RAG、模型管理、工具和部署能力。
  • Coze / Coze Studio - 字节跳动的 Agent 平台;Coze Studio 是可自部署的开源版,支持可视化编排、知识库、插件和应用发布。
  • n8n - 通用工作流自动化平台,拥有大量服务集成和 AI 节点;它采用 fair-code / Sustainable Use License,不等同于 OSI 定义的开源许可证。

开发者 SDK 与框架

  • LangGraph - 以状态图和显式控制流构建可循环、可恢复的 Agent 与多 Agent 工作流。
  • LlamaIndex - 以数据接入、索引、检索和 Workflows 见长的 Agent/RAG 框架。
  • CrewAI - Python 多 Agent 编排框架,提供角色、任务、Flows、工具、记忆和检查点等抽象。
  • PydanticAI - Pydantic 团队推出的类型安全 Agent 框架,适合重视结构化输出、校验和测试的 Python 项目。
  • DSPy - Stanford NLP 的程序化 LLM 框架,以模块化程序、示例和评估数据优化提示词与推理流程。
  • Google ADK - Google 的 code-first Agent Development Kit,支持多 Agent、工作流、评估和部署到本地或 Google Cloud。
  • Microsoft Agent Framework - Microsoft 面向 Python 和 .NET 的 Agent 框架,融合 AutoGen 与 Semantic Kernel 的经验,提供状态、工作流、MCP、A2A 和遥测能力。
  • Mastra - TypeScript Agent 框架,集成 Agent、工作流、记忆、RAG、存储、评估和 Studio。

浏览器自动化

  • Browser Use - 让 Agent 通过浏览器完成点击、输入、表单和网页数据提取,提供 Python 库、CLI 及云端浏览器。
  • Stagehand - Browserbase 的浏览器 Agent SDK,在 Playwright 基础上提供 actextractobserve 和自然语言 Agent 能力。
  • Skyvern - 以视觉模型驱动浏览器工作流,适合登录、填表、后台操作等结构化任务,并支持本地或云端运行。

知识管理与数据增强

网页解析与爬虫

  • Crawl4AI - 面向 LLM 的开源爬虫,将网页转换为适合 RAG、Agent 和数据管道使用的 Markdown 或结构化结果。
  • Firecrawl - 网页搜索、抓取、爬取和交互 API,支持动态页面、Markdown、截图、结构化 JSON 与 MCP。
  • Jina Reader - 将网页转换为适合模型阅读的 Markdown,适合与搜索 API 组合成轻量检索链路。

文档解析与 OCR

  • PaddleOCR - 飞桨的 OCR 与文档解析工具,覆盖文字、表格、公式、图表、版面分析和多语言场景。
  • MinerU - 将 PDF、Office、图片和网页解析为适合 LLM、RAG 和 Agent 使用的 Markdown/JSON,擅长复杂版面与中文文档。
  • Docling - IBM Research 开源的文档转换与结构化工具,适合本地、企业和离线文档处理流程。

RAG 系统与检索框架

  • AnythingLLM - 面向个人和小团队的本地知识库、文档问答和 Agent 工作区。
  • RAGFlow - 强调深度文档理解的 RAG 引擎,适合扫描件、表格和复杂文档。
  • LightRAG - 轻量的图增强 RAG 实现,在向量检索之外利用实体和关系组织上下文。
  • Microsoft GraphRAG - 用知识图谱和社区摘要增强复杂关系型问题的检索流程。
  • Haystack - deepset 的开源 AI 编排框架,以显式 Pipeline、检索、文档库和 Agent 工作流见长。

向量数据库与检索存储

  • Qdrant - Rust 实现的向量数据库,支持过滤、稀疏/稠密向量和自托管。
  • Milvus - 面向大规模向量检索的开源数据库,适合高吞吐和分布式部署。
  • pgvector - PostgreSQL 的向量扩展,适合希望在现有关系库中统一管理结构化数据和向量的项目。

记忆

  • Mem0 - 为 Agent 提供用户级和会话级长期记忆的记忆层。
  • Letta - 从 MemGPT 演化而来的有状态 Agent 平台,强调 Agent 自主管理记忆和长期运行。
  • Graphiti - 面向 Agent 的时序知识图谱记忆,适合表示会随时间变化的实体和事实。

本地模型、部署与 AI 基建

本地模型与推理工具

  • Ollama - 在个人电脑上运行和管理模型的简洁工具,提供命令行、API 和模型库。
  • llama.cpp - 轻量跨平台 C/C++ 推理实现,GGUF 生态和 CPU/消费级 GPU 部署的重要基础。
  • vLLM - 面向服务器和高并发的推理与 OpenAI-compatible 服务框架。
  • SGLang - 面向结构化生成、Agent 和高吞吐服务的推理框架。
  • MLX / MLX LM - Apple Silicon 上的机器学习和本地模型推理生态。
  • TensorRT-LLM - NVIDIA GPU 上的高性能 LLM 推理优化与部署工具链。
  • LMDeploy - 面向多种硬件和模型的高效推理、量化与服务工具。

模型网关

  • LiteLLM - 开源 AI Gateway/SDK,以统一接口接入大量模型提供商,并提供路由、fallback、预算和日志能力。
  • OpenRouter - 云端统一模型入口,集中访问不同供应商的模型并按用量计费;具体价格、隐私和路由策略需逐模型查看。
  • New API - 模型聚合与分发网关,支持 OpenAI、Claude、Gemini 等协议转换及多渠道管理;部署时应注意密钥、上游服务条款和合规性。

可观测性与评估

  • Langfuse - 开源 LLM 工程平台,提供 tracing、Prompt 管理、成本统计和评估,可自托管。
  • Arize Phoenix - 基于 OpenTelemetry/OpenInference 的 LLM、RAG 和 Agent 观测与评估工具。
  • Opik - Comet 的开源 LLM/Agent 追踪与评估平台,支持自托管、在线评估和实验对比。
  • Promptfoo - 用于 Prompt/模型回归测试、红队测试、漏洞扫描和多模型对比的 CLI 工具。
  • Ragas - 专注 RAG 检索质量、上下文相关性和答案忠实度评估的框架。

协议、工具生态与安全运行时

  • Model Context Protocol(MCP) - 连接模型、工具、数据源和应用的开放协议;适合解决 Agent-to-tool / Agent-to-data 的互操作问题。
  • Agent2Agent(A2A) - 由 Google 发起、现由 Linux Foundation 社区维护的 Agent-to-Agent 通信协议,补足跨 Agent 协作场景。
  • E2B - 为 AI Agent 执行不可信代码提供隔离沙箱和 Code Interpreter 的云服务。

多模态工具与开源项目

图像与工作流

  • ComfyUI - 节点式图像、视频、音频和 3D 工作流工具,适合组合不同模型、ControlNet、LoRA 与自定义节点。
  • FLUX.2 - Black Forest Labs 的图像生成/编辑模型系列,适合本地工作流和研究;不同版本的开放范围与许可证需分别核对。
  • Qwen-Image - Qwen 图像生成与编辑模型,在文字渲染和精确编辑场景具有代表性。
  • InvokeAI - 面向创作的开源图像生成工作台,提供节点、画布、模型管理和本地部署能力。

视频与 3D

  • Wan 2.2 - Alibaba 开源的视频生成模型,适合本地部署、研究和 ComfyUI 工作流。
  • HunyuanVideo - 腾讯开源的视频生成模型家族,覆盖文生视频、图生视频和角色/音频相关方向。
  • LTX-2 - Lightricks 的开放视频与音频生成模型,强调本地运行、速度和音视频联合生成。
  • Hunyuan3D - 腾讯的图像到 3D 资产与 PBR 材质生成模型。
  • TRELLIS.2 - Microsoft 的开放图像到 3D 研究项目,适合网格、材质和本地实验。

语音与音乐

  • Fish Speech - 开源多语言 TTS 与语音克隆项目,支持情绪和韵律控制;模型许可证需单独确认。
  • CosyVoice - FunAudioLLM 的多语言语音合成项目,支持流式合成、跨语言和零样本音色复刻。
  • Chatterbox - Resemble AI 的开源 TTS,提供情绪控制、实时合成和零样本语音克隆。
  • GPT-SoVITS - 开源少样本语音克隆与 TTS 工具,中文社区使用广泛。
  • ACE-Step - 开源音乐生成基础模型,支持歌曲、歌词、编辑、Remix 和本地运行。

使用声音克隆、人物肖像和音乐生成时,请确认已获得授权,并分别检查训练数据、模型、输入素材和最终输出的许可证及平台条款。

学习资源与集锦

教程与收录

提示词与规范