安全与可信·EASYHUB 选读
New Relic 公布 AI Evaluation:把 LLM-as-a-judge 分数写进分布式 Trace,同时评测质量、安全与成本

这次有什么变化
New Relic 10 月 6 日公布 AI Evaluation,作为 AI Observability 的新能力,用异步 LLM-as-a-judge 服务对采样的生产遥测进行评测,并把概率质量分数附着到确定性的分布式 Trace 上。预置 guardrails 可检查幻觉、prompt injection、越狱、PII 泄漏、毒性与偏见,并结合 RAG faithfulness、answer relevancy 和 token 成本分析,帮助定位问题来自 prompt、向量数据库还是后端。产品还计划提供 Prompt Playground、可版本化 golden datasets 与 A/B 实验。AI Evaluation 计划在 11 月进入 public preview,因此当前属于正式公告而非 GA。
- 原文标题
- New Relic Introduces AI Evaluation to Close the Loop Across the Entire Developer-to-Production Lifecycle with Transaction-level Business Impact
- 来源
- New Relic · newrelic.com
- 主题
- 安全与可信
- 原文月份
- 2026-10
本页是 EasyHub 根据所列来源整理的简短选读,不是完整报道或原创采访。预览、计划开放与正式可用以摘要及原文说明为准。
本站摘要页面发布 · 内容说明