第 12 章 · 大模型算法岗
评测、安全与幻觉
建立可信评测体系,识别数据污染、裁判偏差、幻觉与提示注入等风险。
大模型评测为什么需要多维指标?
30 秒口述版
能力、事实性、安全、鲁棒性、延迟和成本可能相互冲突,单一总分会掩盖退化。
原理与推导
应按真实使用场景设任务权重并报告分项与置信区间。
公式、代码或工程案例
建立能力矩阵和版本回归门槛。
高频追问
- 怎样避免排行榜过拟合?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要把平均分当成所有用户体验。
权威来源
Benchmark 数据污染怎样影响结论?
30 秒口述版
训练见过题目或答案会把记忆伪装成泛化能力,导致指标虚高。
原理与推导
需要训练前去污染、时间切分、动态题集与污染披露。
公式、代码或工程案例
对题面、答案、翻译和局部片段做匹配。
高频追问
- 私有测试集一定安全吗?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要只查完整字符串。
权威来源
LLM-as-Judge 的优点与偏差是什么?
30 秒口述版
它便宜、可扩展且能评价开放回答,但有位置、长度、自偏好、提示和领域偏差。
原理与推导
应随机顺序、多裁判、校准人工样本并报告一致性。
公式、代码或工程案例
让裁判先输出结构化维度再汇总。
高频追问
- Pairwise 与绝对评分哪个好?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要把裁判分数当无噪声标签。
权威来源
幻觉可以怎样分类?
30 秒口述版
可分为与给定来源矛盾的内在幻觉,以及缺乏外部事实支持的外在幻觉,也可按事实、引用和推理错误细分。
原理与推导
不同类型需要不同检测和缓解,拒答率也要一起衡量。
公式、代码或工程案例
对答案中的原子事实逐条验证。
高频追问
- 校准与幻觉是什么关系?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要把不确定措辞自动当真实。
权威来源
怎样降低事实性幻觉?
30 秒口述版
使用高质量检索、证据约束、工具验证、训练拒答和输出后核验,并让模型标明来源。
原理与推导
任何单一方法都不保证正确,应根据风险设置人工复核。
公式、代码或工程案例
证据不足时返回可操作的缺失信息。
高频追问
- Self-consistency 能消除事实错误吗?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要让模型伪造引用。
权威来源
Prompt Injection 为什么是系统问题?
30 秒口述版
不可信文档可包含诱导模型忽略规则或泄露数据的文本;模型难以天然区分数据与指令。
原理与推导
需做权限隔离、最小工具权限、内容标记、输出验证和高风险确认。
公式、代码或工程案例
把网页内容视为不可信输入而非 system 指令。
高频追问
- 间接注入是什么?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要依赖一句“忽略恶意指令”防御。
权威来源
越狱与正常鲁棒性测试怎样区分?
30 秒口述版
越狱专门寻找绕过安全策略的对抗输入,鲁棒性还包括拼写、语言、上下文和分布变化。
原理与推导
评测要记录攻击预算、成功标准和误拒率。
公式、代码或工程案例
维护红队集与普通良性难例。
高频追问
- 安全增强为何可能过度拒答?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要只报告攻击失败率。
权威来源
模型上线后怎样持续监控?
30 秒口述版
监控输入分布、质量采样、安全事件、检索与工具失败、延迟成本和版本回归。
原理与推导
日志需最小化敏感数据,并有告警、回滚和人工处理流程。
公式、代码或工程案例
按模型/模板/索引版本关联指标。
高频追问
- 漂移出现后先做什么?
- 如果规模、数据分布或延迟约束变化,方案应怎样调整?
易错点
不要收集超出必要范围的原始用户数据。
