← 返回 AI大模型从0到1——理论与实操
F-02 AI应用评测
LangSmith, langfuse
Promptfoo
Merlin
🐵 本质:一个 Agent + 评测一体化的最小可运行框架。可以理解成一个针对Agent的A/B实验平台,可以评测不同的模型或不同的agent策略(如ReAct/Plan-Execute)
Bash
1 | |
通常会得到类似如下结构:
Plain Text
1 2 3 4 5 6 7 8 9 10 11 12 | |
