Overview
产品概述
Capabilities
核心能力
LLM 评估与 AI 系统测试
支持对 LLM 产品(如聊天机器人、RAG 应用、AI 智能体和 copilot)进行端到端测试。可配置指标以匹配风险场景,在问题影响用户之前发现幻觉、正确性差距和安全风险,并验证单个提示或完整交互。
自动化评估与可视化报告
可使用 Python 库运行即席检查与实验,将评估嵌入流水线,并通过可共享的可视化报告探索结果;内置 100+ 指标,支持内置与自定义指标(事实性、有帮助性、相关性等),也可结合规则、分类器和 LLM 评估。
合成数据生成
可根据具体用例生成逼真、边缘情况或对抗性输入,从无害提示到恶意攻击;支持模拟交互与完整用户会话,帮助扩展测试覆盖并探测 AI 在压力下的韧性。
持续监控与漂移检测
通过实时仪表板持续跟踪评估结果和质量检查,及早发现漂移、回归和新出现的风险;支持在发布后持续运行测试、评估实时数据,并验证新版本与提示更新。
Use Cases
适用场景
-
01
对抗性测试
覆盖越狱、PII 泄露、有害内容等风险,可针对最新威胁调整测试,探测 AI 系统的韧性与安全性。
-
02
RAG 应用评估
评估 RAG 系统的幻觉与检索失败,检查检索质量和上下文相关性,减少生成内容的事实性错误。
-
03
AI 智能体测试
对多步骤工作流和工具使用进行测试,确保 AI 智能体在复杂任务中的可靠性和安全性。
-
04
生产 ML 系统监控
监控数据漂移、预测性能和数据质量,在模型上线后持续捕捉异常、缺失值和新兴风险,维护生产模型质量。
Integrations
集成能力
MLflow
根据用户实践,可将 Evidently 与 MLflow 集成,以增强 MLOps 平台的模型监控能力。