云镜收藏

稍后阅读

清单保存在当前浏览器,方便下次回来继续阅读。

清单还是空的

在笔记卡片或正文页点击“加入稍后阅读”即可收藏。

展开章节与本页目录
十四章问道录01机器学习与深度学习基础02Tokenizer 与表示学习03Transformer 与注意力04模型架构与 Scaling05预训练数据与优化06分布式训练07SFT 与参数高效微调08对齐与推理能力09推理与服务优化10RAG 与检索系统11Agent 与工具调用12评测、安全与幻觉13多模态大模型14编程与系统设计题本章问题01大模型评测为什么需要多维指标?02Benchmark 数据污染怎样影响结论?03LLM-as-Judge 的优点与偏差是什么?04幻觉可以怎样分类?05怎样降低事实性幻觉?06Prompt Injection 为什么是系统问题?07越狱与正常鲁棒性测试怎样区分?08模型上线后怎样持续监控?

第 12 章 · 大模型算法岗

评测、安全与幻觉

建立可信评测体系,识别数据污染、裁判偏差、幻觉与提示注入等风险。

8 道核心题校订于 2026年8月31日
评测安全幻觉LLM-as-Judge

大模型评测为什么需要多维指标?

30 秒口述版

能力、事实性、安全、鲁棒性、延迟和成本可能相互冲突,单一总分会掩盖退化。

原理与推导

应按真实使用场景设任务权重并报告分项与置信区间。

公式、代码或工程案例

建立能力矩阵和版本回归门槛。

高频追问

  • 怎样避免排行榜过拟合?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要把平均分当成所有用户体验。

权威来源


Benchmark 数据污染怎样影响结论?

30 秒口述版

训练见过题目或答案会把记忆伪装成泛化能力,导致指标虚高。

原理与推导

需要训练前去污染、时间切分、动态题集与污染披露。

公式、代码或工程案例

对题面、答案、翻译和局部片段做匹配。

高频追问

  • 私有测试集一定安全吗?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要只查完整字符串。

权威来源


LLM-as-Judge 的优点与偏差是什么?

30 秒口述版

它便宜、可扩展且能评价开放回答,但有位置、长度、自偏好、提示和领域偏差。

原理与推导

应随机顺序、多裁判、校准人工样本并报告一致性。

公式、代码或工程案例

让裁判先输出结构化维度再汇总。

高频追问

  • Pairwise 与绝对评分哪个好?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要把裁判分数当无噪声标签。

权威来源


幻觉可以怎样分类?

30 秒口述版

可分为与给定来源矛盾的内在幻觉,以及缺乏外部事实支持的外在幻觉,也可按事实、引用和推理错误细分。

原理与推导

不同类型需要不同检测和缓解,拒答率也要一起衡量。

公式、代码或工程案例

对答案中的原子事实逐条验证。

高频追问

  • 校准与幻觉是什么关系?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要把不确定措辞自动当真实。

权威来源


怎样降低事实性幻觉?

30 秒口述版

使用高质量检索、证据约束、工具验证、训练拒答和输出后核验,并让模型标明来源。

原理与推导

任何单一方法都不保证正确,应根据风险设置人工复核。

公式、代码或工程案例

证据不足时返回可操作的缺失信息。

高频追问

  • Self-consistency 能消除事实错误吗?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要让模型伪造引用。

权威来源


Prompt Injection 为什么是系统问题?

30 秒口述版

不可信文档可包含诱导模型忽略规则或泄露数据的文本;模型难以天然区分数据与指令。

原理与推导

需做权限隔离、最小工具权限、内容标记、输出验证和高风险确认。

公式、代码或工程案例

把网页内容视为不可信输入而非 system 指令。

高频追问

  • 间接注入是什么?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要依赖一句“忽略恶意指令”防御。

权威来源


越狱与正常鲁棒性测试怎样区分?

30 秒口述版

越狱专门寻找绕过安全策略的对抗输入,鲁棒性还包括拼写、语言、上下文和分布变化。

原理与推导

评测要记录攻击预算、成功标准和误拒率。

公式、代码或工程案例

维护红队集与普通良性难例。

高频追问

  • 安全增强为何可能过度拒答?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要只报告攻击失败率。

权威来源


模型上线后怎样持续监控?

30 秒口述版

监控输入分布、质量采样、安全事件、检索与工具失败、延迟成本和版本回归。

原理与推导

日志需最小化敏感数据,并有告警、回滚和人工处理流程。

公式、代码或工程案例

按模型/模板/索引版本关联指标。

高频追问

  • 漂移出现后先做什么?
  • 如果规模、数据分布或延迟约束变化,方案应怎样调整?

易错点

不要收集超出必要范围的原始用户数据。

权威来源