<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>开源工具 on neutrino</title><link>https://neutrino843.github.io/tags/%E5%BC%80%E6%BA%90%E5%B7%A5%E5%85%B7/</link><description>Recent content in 开源工具 on neutrino</description><generator>Hugo -- gohugo.io</generator><language>zh-cn</language><lastBuildDate>Sat, 03 Oct 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://neutrino843.github.io/tags/%E5%BC%80%E6%BA%90%E5%B7%A5%E5%85%B7/index.xml" rel="self" type="application/rss+xml"/><item><title>AI学习（第四期）：提示词工程工具箱——8 个值得知道的开源工具</title><link>https://neutrino843.github.io/post/ai-prompt-toolbox-tools/</link><pubDate>Sat, 03 Oct 2026 00:00:00 +0000</pubDate><guid>https://neutrino843.github.io/post/ai-prompt-toolbox-tools/</guid><description>&lt;h2 id="前言提示词写好了然后呢"&gt;前言：提示词写好了，然后呢
&lt;/h2&gt;&lt;p&gt;第三期我们把“怎么写好提示词”讲完了：先用&lt;strong&gt;五格拆解法&lt;/strong&gt;拆开 5 组常用提示词，提炼成 8 条能直接复制的普适技巧；再把不同类型 AI 工具的写法差异、以及“从需求拆解到 prompt 落地”的五步流程讲了一遍。&lt;/p&gt;
&lt;p&gt;但真正上手之后，很多人会撞上第三期没有展开的那类问题：&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;“提示词写一次好用、换个场景就不好用了，怎么办？”&lt;/p&gt;
&lt;p&gt;“我改了提示词，怎么知道新版是不是真的比旧版好？”&lt;/p&gt;
&lt;p&gt;“上线之后偶尔抽风，我根本不知道是哪一步出的问题。”&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;这类问题，靠“把提示词写得更漂亮”是解决不了的——&lt;strong&gt;它们已经不是“写作问题”，而是“工程问题”&lt;/strong&gt;。所以这一期单独把工具拎出来讲：盘点 8 个业内认可度较高的提示词工程开源项目，说清每个工具“解决什么问题、怎么部署、适合谁”，并附上可横向对比的数据与一份选型清单。&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;阅读提示&lt;/strong&gt;：这一期偏“工程向”，如果你暂时用不上这些工具，也完全不影响把提示词用好——第三期讲的那些技巧，才是真正每天都在用的东西。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;hr&gt;
&lt;h2 id="一先想清楚你要解决的是哪个环节的问题"&gt;一、先想清楚：你要解决的是哪个环节的问题
&lt;/h2&gt;&lt;p&gt;“提示词工程工具”这个词其实很含糊。按工作环节，工具可以分成五类。&lt;strong&gt;先定位你的痛点，再挑工具&lt;/strong&gt;，不然很容易装了一堆用不上：&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;你遇到的痛点&lt;/th&gt;
 &lt;th&gt;对应环节&lt;/th&gt;
 &lt;th&gt;该看哪一类工具&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;提示词写一次好用、写在别处就不好用&lt;/td&gt;
 &lt;td&gt;复用&lt;/td&gt;
 &lt;td&gt;模式库 / 提示词管理&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;不知道新版本提示词是不是真的比旧版好&lt;/td&gt;
 &lt;td&gt;评测&lt;/td&gt;
 &lt;td&gt;评测框架 / 回归测试&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;上线后偶尔抽风，不知道哪一步出了问题&lt;/td&gt;
 &lt;td&gt;观测&lt;/td&gt;
 &lt;td&gt;可观测性 / 追踪&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;输出格式总是差一点，程序解析不了&lt;/td&gt;
 &lt;td&gt;约束&lt;/td&gt;
 &lt;td&gt;约束生成&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;不想手调提示词，想让算法帮我调&lt;/td&gt;
 &lt;td&gt;优化&lt;/td&gt;
 &lt;td&gt;自动优化框架&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;hr&gt;
&lt;h2 id="二八个值得知道的开源项目"&gt;二、八个值得知道的开源项目
&lt;/h2&gt;
 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;数据说明&lt;/strong&gt;：以下信息以各项目&lt;strong&gt;官方仓库与官方文档&lt;/strong&gt;为准。星标、最新版本、最近提交时间等数据&lt;strong&gt;查询于 2026-10-03&lt;/strong&gt;，会随时间变化，&lt;strong&gt;选型前请自己再确认一次&lt;/strong&gt;（尤其是“Open Core”类项目，哪些功能在开源许可下、哪些在企业版里，差别很大）。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;① Fabric&lt;/strong&gt;：把提示词做成可复用的“模式库”（零代码首选）&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：把你重复用到的提示词整理成可复用的 &lt;strong&gt;Patterns（模式）&lt;/strong&gt;，通过命令行直接调用各种大模型完成任务（总结、提取、改写、分析等）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：MIT / Go。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 4.4 万+ ｜ 最新版本 v1.4.507 ｜ 最近提交 2026-10-03（维护活跃）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：官方提供一键安装脚本；Windows 也可用包管理器安装（官方给出的命令包括 &lt;code&gt;winget install danielmiessler.Fabric&lt;/code&gt;），另有 Docker 方式。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：习惯命令行、希望把一套固定提问方式沉淀下来反复用的人；也适合做批量文本处理（例如把一批文章统一改写、统一提取要点）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：几乎不需要写代码；模式可复用、可分享；支持多种模型供应商。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：需要自己配 API Key；它本身&lt;strong&gt;不做评测和安全测试&lt;/strong&gt;；模式库的质量依赖社区贡献。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一句话&lt;/strong&gt;：如果你只想“把好用的提示词存起来随时调用”，这是最容易上手的起点。&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;② promptfoo&lt;/strong&gt;：提示词的“单元测试 + 红队”（评测入门首选）&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：用声明式配置（YAML）定义提示词与测试用例，自动跑评测、对比不同模型 / 不同提示词的效果，支持多种评判方式（字符串相似度、正则、LLM 当裁判等）；同时提供&lt;strong&gt;红队测试&lt;/strong&gt;能力，用于扫描提示词与 AI 应用的安全漏洞。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：MIT / TypeScript（Node.js）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 2.6 万+ ｜ 最新版本 0.123.1 ｜ 最近提交 2026-10-03（维护活跃）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：命令行工具，官方给出的安装方式包括 &lt;code&gt;npm install -g promptfoo&lt;/code&gt;、&lt;code&gt;npx promptfoo@latest&lt;/code&gt;、&lt;code&gt;brew&lt;/code&gt;、&lt;code&gt;pip&lt;/code&gt; 等；典型流程是初始化示例 → 跑评测 → 打开本地报告页面查看结果。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：想验证“B 版提示词是不是真的比 A 版好”；想把提示词评测接入 CI，每次改完自动跑一遍，防止效果回退。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：配置驱动，基本不用写代码；&lt;strong&gt;默认本地运行，数据不外传&lt;/strong&gt;；支持的模型供应商很多。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：评测本身要调用模型 API（有成本）；复杂场景仍可能需写少量代码；它聚焦“上线前”，&lt;strong&gt;没有生产环境的持续监控能力&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;需要知道的变化&lt;/strong&gt;：&lt;strong&gt;2026 年 3 月 9 日，promptfoo 官方宣布被 OpenAI 收购&lt;/strong&gt;（OpenAI 官方公告与 promptfoo 官方博客均有说明），官方同时明确&lt;strong&gt;项目仍然开源、仍为 MIT 许可证&lt;/strong&gt;。这里把它写出来不是要劝退，而是想说明一个选型常识：&lt;strong&gt;开源项目的治理归属会变，评估工具时要顺带看一眼它属于谁、路线图会不会偏向某一家的生态。&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;③ Langfuse&lt;/strong&gt;：提示词管理 + 线上观测 + 评估的一体化平台&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：LLM 应用的&lt;strong&gt;可观测性（追踪每次调用）&lt;/strong&gt;、&lt;strong&gt;提示词管理（集中管理、版本控制、协作迭代、一键回滚）&lt;/strong&gt;、&lt;strong&gt;评估（LLM 当裁判 / 人工标注 / 自定义评估）&lt;/strong&gt;，还有用于试提示词的 Playground。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：&lt;strong&gt;Open Core&lt;/strong&gt;——&lt;strong&gt;核心部分是 MIT 许可&lt;/strong&gt;，但 &lt;code&gt;ee/&lt;/code&gt; 目录下的内容由商业许可（Langfuse Enterprise License）管理。语言以 TypeScript 为主，提供 Python / JS-TS SDK。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 3.5 万+ ｜ 最新版本 v4.50.0 ｜ 最近提交 2026-10-02（维护活跃）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：可以用官方云服务；&lt;strong&gt;也支持完全自托管&lt;/strong&gt;，官方提供本地 Docker Compose（&lt;code&gt;docker compose up&lt;/code&gt;）、单机、Kubernetes（Helm）以及云厂商 Terraform 等多种方案。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：团队协作开发 AI 应用；把提示词从代码里抽出来单独管理；上线后定位“哪一步调用出的问题”。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：能完全自托管、数据自己拿着；生态集成多（OpenTelemetry 体系、主流应用框架）；提示词版本管理这块体验成熟。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：自托管是多组件的，有运维成本；接入需要在代码里加 SDK / 埋点；&lt;strong&gt;企业功能在商业许可里，不是全都能白嫖&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一句话&lt;/strong&gt;：从“个人调提示词”升级到“团队管提示词”时，这是最常见的落点。&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;④ Agenta&lt;/strong&gt;：面向团队的一体化 LLMOps 平台（UI 友好）&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：把&lt;strong&gt;提示词工程、评估（人工评估 + 自动评估）、可观测性（原生 OpenTelemetry 追踪）&lt;/strong&gt;整合在一个平台里。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：同样是 &lt;strong&gt;Open Core&lt;/strong&gt;——核心 MIT，&lt;code&gt;ee/&lt;/code&gt; 目录单独许可。前端 TypeScript，后端 Python。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 4.8k ｜ 最新版本 v0.121.7 ｜ 最近提交 2026-10-03（维护活跃）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：有官方云服务；自托管用官方提供的 Docker Compose 方案。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：团队里既有工程师也有产品 / 领域专家时，让&lt;strong&gt;不写代码的人也能在界面上对比提示词、跑评估&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：UI 上手门槛低；追踪基于 OpenTelemetry，和现有可观测体系兼容；支持较多模型。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：自托管要起多个服务，部署难度中偏高；深度集成仍需写代码。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一句话&lt;/strong&gt;：和 Langfuse 定位接近，&lt;strong&gt;选哪个主要看团队里“不写代码的人”占多少&lt;/strong&gt;——那部分人越多，UI 友好度越重要。&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;⑤ DeepEval&lt;/strong&gt;：像写单元测试一样写 AI 测试（Python 用户）&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：一个开源的大模型评估框架，写法&lt;strong&gt;类似 Pytest&lt;/strong&gt;——你把评测写成测试用例，覆盖相关性、忠实度、幻觉、任务完成度、RAG 指标、多轮对话指标等等。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：Apache-2.0 / Python。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 1.9 万+ ｜ 最新版本 python-v4.2.4 ｜ 最近提交 2026-10-02（维护活跃）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：&lt;code&gt;pip install -U deepeval&lt;/code&gt;，然后按官方方式跑测试命令。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：给 RAG、Agent、客服机器人写回归测试；在 CI 里给质量把关；对比不同提示词 / 模型 / 架构的效果。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：和 Python 测试生态无缝衔接；指标覆盖广；部分指标可以本地跑，不依赖外部 API。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：&lt;strong&gt;必须写 Python&lt;/strong&gt;；多数指标依赖“用模型当裁判”，需要 API Key。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一句话&lt;/strong&gt;：如果你是开发者，且有“每次改完提示词都要自动验一遍”的需求，它是最顺手的。&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;⑥ Guidance&lt;/strong&gt;：强制输出符合格式的“约束生成”&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：用编程方式把&lt;strong&gt;控制流（条件、循环、工具调用）和生成过程交织&lt;/strong&gt;起来，并且可以&lt;strong&gt;强制模型的输出符合正则、上下文无关文法（CFG）或 JSON Schema&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：MIT / Python。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 2.2 万+ ｜ 最新版本 0.3.2 ｜ 最近提交 2026-05-21。&lt;strong&gt;注意：它的更新频率明显低于本表其他项目&lt;/strong&gt;，选型前建议先看仓库近况。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：&lt;code&gt;pip install guidance&lt;/code&gt;，配合你选用的后端模型一起用。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：输出的东西必须“能被程序正确解析”时——比如固定结构的 JSON、特定格式的文本、需要严格遵循语法的生成任务。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：约束能力强，能显著减少“就差一个括号 / 一个字段”的返工；也能降低无效 token 的消耗。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：必须写 Python；部分高级约束需要后端模型支持；适合工程场景，不适合纯聊天用户。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一句话&lt;/strong&gt;：&lt;strong&gt;“让模型不可能输出错误格式”&lt;/strong&gt;，比“在提示词里反复强调要输出 JSON”可靠得多。&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;⑦ DSPy&lt;/strong&gt;：不手写提示词，让算法帮你优化&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：用&lt;strong&gt;写代码的方式构建 LLM 程序&lt;/strong&gt;（把任务拆成可组合的模块），再由框架的优化算法&lt;strong&gt;自动寻找更好的提示词 / 示例组合&lt;/strong&gt;。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：MIT / Python，由斯坦福团队维护。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 3.8 万+ ｜ 最新版本 3.4.0 ｜ 最近提交 2026-10-02（维护活跃）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：&lt;code&gt;pip install dspy&lt;/code&gt;，纯 Python 库。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：要做多阶段的复杂流水线（分类、检索问答、Agent 循环），并且希望效果&lt;strong&gt;可复现、可自动化调优&lt;/strong&gt;，而不是靠手感改提示词。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：把“提示词调优”从手艺变成流程；有配套论文与持续演进的优化器；社区大。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：&lt;strong&gt;必须写 Python，学习曲线明显&lt;/strong&gt;；要有一定的评测数据才能发挥价值；依赖模型 API。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一句话&lt;/strong&gt;：它代表的是另一种思路——&lt;strong&gt;不是把提示词写好，而是把提示词交给程序去优化&lt;/strong&gt;。对纯使用者来说门槛偏高，但值得知道这条路存在。&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;&lt;strong&gt;⑧ OpenLIT&lt;/strong&gt;：OpenTelemetry 原生的可观测 + 评估&lt;/summary&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;核心功能&lt;/strong&gt;：基于 OpenTelemetry 的 AI 工程平台，用很少的代码给 LLM 应用接上可观测性（追踪、成本、延迟），同时提供评估、提示词版本管理、Playground 等能力。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;许可证 / 语言&lt;/strong&gt;：Apache-2.0 / Python SDK（另有 TypeScript、Go SDK；平台前端为 TypeScript）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;仓库数据&lt;/strong&gt;：星标 2.8k ｜ 最新版本 openlit-2.1.0 ｜ 最近提交 2026-10-01（维护活跃）。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;部署方式&lt;/strong&gt;：SDK 侧 &lt;code&gt;pip install openlit&lt;/code&gt; 并初始化；平台侧官方提供 Docker Compose 自托管方案。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;使用场景&lt;/strong&gt;：&lt;strong&gt;已经有一套 OpenTelemetry 可观测体系&lt;/strong&gt;、希望把 AI 调用也纳进去的团队。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;优势&lt;/strong&gt;：不绑定厂商；接入成本低；自托管、数据本地。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;局限&lt;/strong&gt;：自托管平台多组件、部署难度中等；社区规模明显小于 Langfuse。&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;一句话&lt;/strong&gt;：&lt;strong&gt;如果你公司已经有可观测体系，选它比选一个独立平台更省事。&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/details&gt;
&lt;hr&gt;
&lt;h2 id="三横向对比两张表看清差异"&gt;三、横向对比：两张表看清差异
&lt;/h2&gt;&lt;p&gt;先看&lt;strong&gt;功能定位&lt;/strong&gt;：&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;项目&lt;/th&gt;
 &lt;th&gt;许可证&lt;/th&gt;
 &lt;th&gt;语言&lt;/th&gt;
 &lt;th&gt;一句话定位&lt;/th&gt;
 &lt;th&gt;上手难度&lt;/th&gt;
 &lt;th&gt;要写代码吗&lt;/th&gt;
 &lt;th&gt;最适合&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Fabric&lt;/td&gt;
 &lt;td&gt;MIT&lt;/td&gt;
 &lt;td&gt;Go&lt;/td&gt;
 &lt;td&gt;提示词模式库 + 命令行调用&lt;/td&gt;
 &lt;td&gt;低&lt;/td&gt;
 &lt;td&gt;不用&lt;/td&gt;
 &lt;td&gt;个人、命令行党&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;promptfoo&lt;/td&gt;
 &lt;td&gt;MIT&lt;/td&gt;
 &lt;td&gt;TypeScript&lt;/td&gt;
 &lt;td&gt;提示词评测 + 红队&lt;/td&gt;
 &lt;td&gt;低&lt;/td&gt;
 &lt;td&gt;基本不用&lt;/td&gt;
 &lt;td&gt;改提示词前想验证效果的人&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Langfuse&lt;/td&gt;
 &lt;td&gt;核心 MIT + &lt;code&gt;ee/&lt;/code&gt; 商业许可&lt;/td&gt;
 &lt;td&gt;TypeScript&lt;/td&gt;
 &lt;td&gt;观测 + 提示词管理 + 评估&lt;/td&gt;
 &lt;td&gt;中&lt;/td&gt;
 &lt;td&gt;部分（要接 SDK）&lt;/td&gt;
 &lt;td&gt;团队、要自托管&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Agenta&lt;/td&gt;
 &lt;td&gt;核心 MIT + &lt;code&gt;ee/&lt;/code&gt; 商业许可&lt;/td&gt;
 &lt;td&gt;TS + Python&lt;/td&gt;
 &lt;td&gt;一体化 LLMOps 平台&lt;/td&gt;
 &lt;td&gt;中偏高&lt;/td&gt;
 &lt;td&gt;部分（UI 可免代码）&lt;/td&gt;
 &lt;td&gt;团队、非技术成员多&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;DeepEval&lt;/td&gt;
 &lt;td&gt;Apache-2.0&lt;/td&gt;
 &lt;td&gt;Python&lt;/td&gt;
 &lt;td&gt;类 Pytest 的评估框架&lt;/td&gt;
 &lt;td&gt;低&lt;/td&gt;
 &lt;td&gt;要（Python）&lt;/td&gt;
 &lt;td&gt;开发者做回归测试&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Guidance&lt;/td&gt;
 &lt;td&gt;MIT&lt;/td&gt;
 &lt;td&gt;Python&lt;/td&gt;
 &lt;td&gt;约束生成、强制输出格式&lt;/td&gt;
 &lt;td&gt;中&lt;/td&gt;
 &lt;td&gt;要（Python）&lt;/td&gt;
 &lt;td&gt;要求输出可被程序解析&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;DSPy&lt;/td&gt;
 &lt;td&gt;MIT&lt;/td&gt;
 &lt;td&gt;Python&lt;/td&gt;
 &lt;td&gt;用代码构建 + 算法优化提示词&lt;/td&gt;
 &lt;td&gt;高&lt;/td&gt;
 &lt;td&gt;要（Python）&lt;/td&gt;
 &lt;td&gt;研究者、复杂流水线&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OpenLIT&lt;/td&gt;
 &lt;td&gt;Apache-2.0&lt;/td&gt;
 &lt;td&gt;Python SDK&lt;/td&gt;
 &lt;td&gt;OTel 原生可观测 + 评估&lt;/td&gt;
 &lt;td&gt;中&lt;/td&gt;
 &lt;td&gt;部分&lt;/td&gt;
 &lt;td&gt;已有 OTel 体系的团队&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;再看&lt;strong&gt;活跃度&lt;/strong&gt;（数据查询于 2026-10-03）：&lt;/p&gt;
&lt;table&gt;
 &lt;thead&gt;
 &lt;tr&gt;
 &lt;th&gt;项目&lt;/th&gt;
 &lt;th&gt;GitHub 星标&lt;/th&gt;
 &lt;th&gt;最新版本&lt;/th&gt;
 &lt;th&gt;最近提交&lt;/th&gt;
 &lt;th&gt;维护状态判断&lt;/th&gt;
 &lt;/tr&gt;
 &lt;/thead&gt;
 &lt;tbody&gt;
 &lt;tr&gt;
 &lt;td&gt;Fabric&lt;/td&gt;
 &lt;td&gt;4.4 万+&lt;/td&gt;
 &lt;td&gt;v1.4.507&lt;/td&gt;
 &lt;td&gt;2026-10-03&lt;/td&gt;
 &lt;td&gt;活跃&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;promptfoo&lt;/td&gt;
 &lt;td&gt;2.6 万+&lt;/td&gt;
 &lt;td&gt;0.123.1&lt;/td&gt;
 &lt;td&gt;2026-10-03&lt;/td&gt;
 &lt;td&gt;活跃&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Langfuse&lt;/td&gt;
 &lt;td&gt;3.5 万+&lt;/td&gt;
 &lt;td&gt;v4.50.0&lt;/td&gt;
 &lt;td&gt;2026-10-02&lt;/td&gt;
 &lt;td&gt;活跃&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Agenta&lt;/td&gt;
 &lt;td&gt;4.8k&lt;/td&gt;
 &lt;td&gt;v0.121.7&lt;/td&gt;
 &lt;td&gt;2026-10-03&lt;/td&gt;
 &lt;td&gt;活跃&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;DeepEval&lt;/td&gt;
 &lt;td&gt;1.9 万+&lt;/td&gt;
 &lt;td&gt;python-v4.2.4&lt;/td&gt;
 &lt;td&gt;2026-10-02&lt;/td&gt;
 &lt;td&gt;活跃&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;Guidance&lt;/td&gt;
 &lt;td&gt;2.2 万+&lt;/td&gt;
 &lt;td&gt;0.3.2&lt;/td&gt;
 &lt;td&gt;2026-05-21&lt;/td&gt;
 &lt;td&gt;&lt;strong&gt;更新变慢，需留意&lt;/strong&gt;&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;DSPy&lt;/td&gt;
 &lt;td&gt;3.8 万+&lt;/td&gt;
 &lt;td&gt;3.4.0&lt;/td&gt;
 &lt;td&gt;2026-10-02&lt;/td&gt;
 &lt;td&gt;活跃&lt;/td&gt;
 &lt;/tr&gt;
 &lt;tr&gt;
 &lt;td&gt;OpenLIT&lt;/td&gt;
 &lt;td&gt;2.8k&lt;/td&gt;
 &lt;td&gt;openlit-2.1.0&lt;/td&gt;
 &lt;td&gt;2026-10-01&lt;/td&gt;
 &lt;td&gt;活跃&lt;/td&gt;
 &lt;/tr&gt;
 &lt;/tbody&gt;
&lt;/table&gt;

 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;怎么读这两张表&lt;/strong&gt;：星标高不代表适合你（Langfuse 和 Agenta 都是 3 万+ / 4.8k，但对个人用户来说都太重了）；&lt;strong&gt;“最近提交”比“星标总数”更能反映一个项目的健康度&lt;/strong&gt;——一个半年没提交的项目，即便星标很高，遇到问题时也可能没人修。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;details&gt;
&lt;summary&gt;术语卡片：LLM-as-judge（用模型当裁判）&lt;/summary&gt;
&lt;p&gt;&lt;strong&gt;LLM-as-judge&lt;/strong&gt;：让一个（通常更强的）模型按照给定的评分标准，去给另一个模型的输出打分。它是目前规模化评估主观质量（是否有帮助、语气是否合适、是否忠于原文）最现实的手段。&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;但它有两个坑：一是&lt;strong&gt;裁判本身有偏见&lt;/strong&gt;（例如偏好更长的回答、偏好和自己风格接近的回答）；二是&lt;strong&gt;裁判会漂移&lt;/strong&gt;（换了模型版本，分数就不可比了）。所以专业做法是：固定裁判模型版本 + 抽样人工作为校准基准。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;/details&gt;
&lt;details&gt;
&lt;summary&gt;术语卡片：红队测试（Red Teaming）&lt;/summary&gt;
&lt;p&gt;&lt;strong&gt;红队测试&lt;/strong&gt;：用对抗性的输入，主动攻击自己的 AI 应用，在真实攻击者之前把漏洞找出来。常见手法包括提示词注入、越狱（jailbreak）、诱导泄露隐私数据、诱导调用不该调用的工具等。&lt;/p&gt;

 &lt;blockquote&gt;
 &lt;p&gt;它和评测的区别在于：评测回答的是“&lt;strong&gt;它做得好不好&lt;/strong&gt;”，红队回答的是“&lt;strong&gt;它会不会被人搞坏&lt;/strong&gt;”。对要上线的 Agent 类应用来说，这两件事都得做——尤其是接入了文件、数据库或支付能力的 Agent。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;/details&gt;
&lt;hr&gt;
&lt;h2 id="四怎么选一个不用纠结的决策清单"&gt;四、怎么选：一个不用纠结的决策清单
&lt;/h2&gt;&lt;ul&gt;
&lt;li&gt;我只想&lt;strong&gt;把好用的提示词存下来反复用&lt;/strong&gt; → &lt;strong&gt;Fabric&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;我想知道&lt;strong&gt;新提示词到底有没有变好&lt;/strong&gt; → &lt;strong&gt;promptfoo&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;我们&lt;strong&gt;团队&lt;/strong&gt;要一起管提示词，还要看线上表现 → &lt;strong&gt;Langfuse&lt;/strong&gt;（偏工程）/ &lt;strong&gt;Agenta&lt;/strong&gt;（偏 UI 友好）&lt;/li&gt;
&lt;li&gt;我是&lt;strong&gt;写 Python 的开发者&lt;/strong&gt;，想把评测接进 CI → &lt;strong&gt;DeepEval&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;我要的是&lt;strong&gt;输出格式永远正确&lt;/strong&gt;，能被程序解析 → &lt;strong&gt;Guidance&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;我不想手写提示词，想让&lt;strong&gt;算法帮我调&lt;/strong&gt; → &lt;strong&gt;DSPy&lt;/strong&gt;&lt;/li&gt;
&lt;li&gt;我们&lt;strong&gt;已经有 OpenTelemetry 体系&lt;/strong&gt;，只想接进去 → &lt;strong&gt;OpenLIT&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;

 &lt;blockquote&gt;
 &lt;p&gt;&lt;strong&gt;一个提醒&lt;/strong&gt;：GitHub 星标数 ≠ 适合你。选型的第一问永远是“&lt;strong&gt;我要解决上面第一章表格里的哪一个痛点&lt;/strong&gt;”，而不是“哪个项目最火”。另外，看到“Open Core”类项目，先翻一下 &lt;code&gt;ee/&lt;/code&gt; 目录的许可证——你需要的功能可能不在开源部分里。&lt;/p&gt;

 &lt;/blockquote&gt;
&lt;p&gt;&lt;strong&gt;如果你是完全没用过工具的新手&lt;/strong&gt;，建议的上手顺序是：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;先用 Fabric&lt;/strong&gt;（装好就能用，几分钟上手），把日常提示词沉淀成自己的模式库；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;再用 promptfoo&lt;/strong&gt; 跑一次“新旧提示词对比”，亲身体会一下“有评测”和“凭感觉”的差别；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;等到需要多人协作、或者要盯线上表现时&lt;/strong&gt;，再考虑 Langfuse / Agenta 这类平台。&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;别一上来就部署平台——&lt;strong&gt;工具是来解决痛点的，不是用来制造“我在做 AI 工程”的错觉的。&lt;/strong&gt;&lt;/p&gt;
&lt;hr&gt;
&lt;h2 id="五写在最后"&gt;五、写在最后
&lt;/h2&gt;&lt;p&gt;这一期其实只讲了一件事：&lt;strong&gt;当“提示词”从一项个人手艺，变成一件需要被管理、被验证、被观测的工程资产时，你就需要工具。&lt;/strong&gt;&lt;/p&gt;
&lt;p&gt;最后留三句话：&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;&lt;strong&gt;先定位痛点，再选工具。&lt;/strong&gt; 复用、评测、观测、约束、优化——先想清楚你卡在哪个环节，再去对应的那一类里挑，而不是“哪个项目最火就装哪个”；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;星标高 ≠ 适合你。&lt;/strong&gt; Langfuse、Agenta 星标都不低，但对个人用户来说都太重了；&lt;strong&gt;“最近提交”比“星标总数”更能反映一个项目的健康度&lt;/strong&gt;；&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;别为了用工具而用工具。&lt;/strong&gt; 很多人只用“好用的提示词 + 一份迭代记录表”（第三期 2.2 的 Step 5），就已经比大多数人高效了——&lt;strong&gt;工具是来解决痛点的，不是用来制造“我在做 AI 工程”的错觉的。&lt;/strong&gt;&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;如果你觉得这期有用，欢迎转发给需要的朋友。&lt;/p&gt;
&lt;h3 id="参考资料"&gt;参考资料
&lt;/h3&gt;&lt;ul&gt;
&lt;li&gt;Fabric：https://github.com/danielmiessler/fabric&lt;/li&gt;
&lt;li&gt;promptfoo：https://github.com/promptfoo/promptfoo ｜ 官方博客《Promptfoo is joining OpenAI》：https://www.promptfoo.dev/blog/promptfoo-joining-openai/&lt;/li&gt;
&lt;li&gt;OpenAI 官方公告《OpenAI to acquire Promptfoo》：https://openai.com/index/openai-to-acquire-promptfoo/&lt;/li&gt;
&lt;li&gt;Langfuse：https://github.com/langfuse/langfuse&lt;/li&gt;
&lt;li&gt;Agenta：https://github.com/Agenta-AI/agenta&lt;/li&gt;
&lt;li&gt;DeepEval：https://github.com/confident-ai/deepeval&lt;/li&gt;
&lt;li&gt;Guidance：https://github.com/guidance-ai/guidance&lt;/li&gt;
&lt;li&gt;DSPy：https://github.com/stanfordnlp/dspy&lt;/li&gt;
&lt;li&gt;OpenLIT：https://github.com/openlit/openlit&lt;/li&gt;
&lt;/ul&gt;

 &lt;blockquote&gt;
 &lt;p&gt;本文中的星标数、版本号与最近提交时间&lt;strong&gt;查询于 2026-10-03&lt;/strong&gt;，仅代表查询时的状态。&lt;/p&gt;

 &lt;/blockquote&gt;</description></item></channel></rss>