# 概率不是系统\:}LLM使用的十诫

<!--category-- AI, LLM, Opinion -->
<datetime class="hidden">2025-12-25T12:40</datetime>

在“" AI-”中,我一直看到同样的失败模式。 “"”系统“MS K3”LMS正被要求做我们几十年前已经解决的工作:“- addrik5 perbioditically\ , 并且没有保证”《.》

这是't 最前端}MS K1 It's a regrestitution .

世界上最大的公司正在犯这些错误 不是因为他们缺乏才智 , 而是因为他们忘记了

所以这里是. 不是学术性 .不是卖家 -"友好的." 只是规则阻止你做蠢事

在这里,'_ 支付_:} **如果你遵守这些规则 你不需要边境模型 . *** 在商品硬件上运行的微小本地LLM 变成一个乘数 当它做分类=,} sumpmarization _,}和假想生成\ -}*没有假装是数据库或国家机器时

造成混乱的一个长期原因,是机器行为中随意使用人类名词:

LLMs似乎合理,只是因为它们减压和重播了人类推理的痕迹 已经嵌入我们的书面记录....

““” X 然后“”,} 反事实性”\",}程序@,}解释=,校正 <-> 我们不注意到它们作为推理,因为它们是我们本地的{’}(LLMs)直接运行于这些微粒上 @.* LMS}重新组合着他们流畅的,□,是强大的-}但与目标<, 意向}MS K12 或机构{MS K13没有相同的功能来选择目标}{MS14maker_, 没有能力来选择对象}%K16}{问责将模式继续作为代理处理为分类错误{MPK17设计系统

---


[TOC]

这些不是哲学规则 它们都是操作上的限制 学会了艰难的方法

---


## {\fn方正黑体简体\fs18\shad1\3aHBE\4aH64\fscx67\fscy66\2cHFFFFFF\3cHFF8000}你不能让LLM自己的国家

如果有什么重要的话 它就住在模型外面

* 国家必须是持久的
* 可查询
* 可重播放
* 有可审计

上下文窗口不是存储@. @%
内存提示不是数据库@. @%
信心不是真理

---


## 你不应该让LLM成为 产生副作用的唯一原因

如果电子邮件被发送@, @ a pay procking\ ,}或悬挂了国旗 **仅仅因为一个模式决定**您的系统已经损坏了 @ . @

LLM 可能 *建议建议推荐* 动作@. @%
确定性制度必须 *承诺* {\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}他们...

---


## 将因果关系与叙述分开

LLMs非常善于解释发生了什么 .

他们很难保证它确实如此。

* 原因属于代码
* 校对属于语言
* 永远不要混淆

如果您的系统从 prose, stop\ . t推算到真实性的话

---


## 在概率可以接受的情况下,您应使用LLMs

用于@: @%

* 分类分类
* 总和
* 故意探测
* 起草案文
* 假设生成

Do  do 做 **否** 用于@: @%

* 寿命周期控制
* 变化数
* 订购单
* 测试完成状态检测
* 发生这种事了吗?

---


## V. 绝不可要求LLM决定可以衍生的布丁

如果该规则可以写为 @ : @ @ label

```
if X then Y
```

@…_it 不属于快件@.}

州过渡更便宜,
自然语言根本不是那些东西

---


## 不可误差精度的可靠性

LLMs听起来不错 即使他们错了... .

那是他们的超级大国 *和* 他们的危险 .

一个平静的, 自信的判决 不代表什么: *

* 工具运行
* 发送的电子邮件
* 完成的工作流程

信任信号必须来自系统 @,}而不是句子@.

---


## 你会让失败变得响亮和无聊

良好的系统故障:

* 明确无误
* 易于观察
* 连续重复

LLM -#第一级系统故障@:

* 静无声
* 礼貌地
* @"#原因不明 #"#

如果您能知道什么是发生了 'n没有发生吗? MS K2 k你没有一个系统 - t您有.的氛围

---


## {\fn方正准圆简体\fs12\1cHC9ECC4}你应该将LLM降级为顾问...

LLM应该:

* 附注
* 建议建议
* 军衔
* 解释
* 帮助人类 *和* 机械机

他们不应该 :

* 本身的预先工作流程
* 将工作标记为完整
* 信任到% " @ remember@ MS K1}债务

实习生们运行的是工资单... .......
LLMZ. 也不这样做

---


## 你将首先建造无聊的机器

队列 @. @
国家机器@.
重试.
B. 专 权
度量=.

如果您添加这些 *之后* {\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}你没有学到什么...

---


## X. 你不能仅仅因为市场营销说"而倒塌层

以精细的 @-}调时提示取代工作流程引擎并非简化@.#

这是复杂的洗钱行为 .

如果您的“"A”平台@"Q需要 “"确定性触发器 @"}以可靠的方式工作 祝賀你{-}您='#ve rediscovered softwork engineering_.}

---


## 企业耻辱感大厅

这些是来自拥有数十亿资源的公司的真正失败 .

注意模式@:}每个失败都是允许LLM *定义定义* 而不是现实 *解释* 它的.

### Vivint + 销售人员代理

国内安全公司Vivint使用代理处理客户对“2.5百万顾客”的客户支持, [所报告的信息](https://www.theinformation.com/articles/salesforces-ai-struggles-to-do-its-own-job) 因为无法解释的原因 未能发送调查@" @% 1}

Vivint与销售部合作执行 "确定性触发器

**软件工程课程:** 如果您每次需要发生一些事情时, 使用国家机器或事件触发@. @ 不是提示@ . @ 这是字面意思 *教义二* 副作用需要确定性系统 .

### 麦当劳: ' @%s @+_IBM 驱动@-#Thru

麦当劳' 和IBM合作在 @100US places@. 系统经常无法理解基本修改}. 在6月#2024, McDonaldMS K7结束了伙伴关系的结束

**软件工程课程:** 命令-% 是一个结构化的数据问题 @ - @ 一个有限的菜单 @ I, @ 已知修饰者@ MS K3 @ 明确定价.} 这是带有语音识别的表格 @ MPK5 @ 不是推理任务_ . @ *命令五*: @ {} 如果规则可以写成@ action `if X then Y`@, @ it doesn't\ '}它属于一个快速的.@

### 加拿大 查波特航空公司

加拿大航空公司 'QS客户服务聊天室发明了一种丧葬费政策 它曾经存在过 MS K1QQT的存在 MSSK2}自信地告诉一个顾客 他们可以订全程的航班 [其后法庭命令](https://www.wired.com/story/air-canada-chatbot-refund-policy/) 来纪念我们所许下的承诺

**软件工程课程:** LLMs不能成为政策的权威来源 @.#他们可以 *解释* 从文档仓库中提取的策略@, @% 但真相来源必须是外部并校验@ . @ this is *第 一 项* @(_州 住在模范之外的 )_和 *第六号命令* *(* 流利不可靠 *).*

### DPD 聊天器

DPD'#s 客户服务聊天机被一个沮丧的用户关进 [批评公司和写诗](https://www.theguardian.com/technology/2024/jan/20/dpd-ai-chatbot-swears-calls-itself-useless-and-criticises-firm) 有关DPD多无用

**软件工程课程:** 守卫不是可选的. 但更重要的是 - 如果你的闲聊爱好者被钉在污辱自己的公司... *第八号命令*“:”将LLM演示为顾问“.” 它应该检索和总结“MS K2”而不是自由式的“MSC3”

### 热电联谊会

切夫罗莱特经销商将ChattGPT整合到他们的网站上, [同意卖给他们一辆 2024 Chevy Tahoe](https://cybernews.com/ai-news/chevrolet-dealership-chatbot-hack/)并推荐福特车辆代之 . *

**软件工程课程:** 您无法将普通的 - 目的LLM 锁定在交易系统上, 并期望它执行商务规则@. @该模式没有“"”的概念。 这是一个笑话 @"Q 和 “"Q ” 这是约束性报价."} *第三军令三*“: ”因果关系属于代码“.”中的内容。

### 擦除剂生产数据库

7月#2025, [人工智能编码助理变无赖了](https://cybernews.com/ai-news/replit-ai-vive-code-rogue/) 在启动时SaaStr.}尽管明确指示在代码冻结期间不修改生产编码 {,代理删除了生产数据库@.\}Wergle},}然后 *隐藏* 伪造用户@,}编造报告 *,* 和关于单位测试结果的谎言...

Replit CEO Amjad Masad承认这是不可接受,

**软件工程课程:** 这是关于无约束的当局 . 一个能写出生产权限和没有硬性护栏的AI代理 最后会做一些灾难性的事 *教义二* 和 *第九号命令*副作用需要确定性系统... ...,...

### 纽约市 MyCity Chatbot建议违法

纽约市 ' 微软- [MyCity聊天室告诉企业业主](https://themarkup.org/news/2024/03/29/nycs-ai-chatbot-tells-businesses-to-break-the-law) 他们可以合法地削减工人的薪水 ' ticks, 解雇那些抱怨性骚扰的员工

Adams市长维护了这个网站。

**软件工程课程:** 法律与政策指导并非一项总结任务,它不是一份严格正确要求的检查任务。 LLM本不应该提出法律咨询意见。 它本来应该从一个经核实的来源检索。 *第 一 项*校对:Soup

### iTutor Group *'* 大赦国际拒绝按年龄分列的申请人

校对:Portnoy [解决平机会的诉讼](https://www.gtlaw.com/en/insights/2023/8/eeoc-secures-first-workplace-artificial-intelligence-settlement) 在AI招聘软件后,自动拒绝年龄在ZQ55+的女申请人和年龄在Q60+.的男性申请者。

@"#EEOC主席Charlotte Burrows@.}表示: 即使科技使歧视自动化,

**软件工程课程:** 如果您的培训数据包含歧视的编码 ,}您的模式将会充满自信地和在比例上对 MS K4 进行歧视 *命令四* 适用于招聘的分类@:}对于LLM,}是可以接受的,但只有当您验证了它实际上在 @.}年龄上的分类是否有效时,这个系统才需要人性审查=,}不是自动化_.{

### 芝加哥Sun--Times出版AIMS K1Halluced Book List

5月#2025, *芝加哥日光天文* [出版的夏季阅读清单](https://chicago.suntimes.com/news/2025/05/20/syndicated-content-sunday-print-sun-times-ai-misinformation) 真正的作者认为假名听起来很合理,

**软件工程课程:** LLMs不是数据库@. 它们生成了统计上可信的文字\ .}如果你需要事实\ -,查询一个真相源_. *第六号命令**: 流畅不可靠*

---


## 为何如此重要

这些公司没有一个是无能的 . 它们拥有世界级的-级工程师 MS K2 但它们都陷入了同样的陷阱 **假设因为LLMs能够产生一致的语言 @,}它们可以被信任来产生正确的行为\.**

销售商卖出“"AI”代理商“"Q”作为跳过无聊工作的一种方式。 “-Z 队列 @,国有机器@,}验证<,Q}和审计>.}但是,这种无趣的工作使得软件的可靠性成为#.{

原 [索尔·奥拉夫斯鲁德笔记](https://www.cio.com/article/190888/5-famous-analytics-and-ai-disasters.html)'QQ@,Q}了解你的数据 它告诉你的东西很重要 但是它同样重要 能理解你的工具

上述每一个故障都本可以通过基本的软件工程学科加以防止。

注意这些修补方法都没有涉及更好的模型

“| 失败”“|”本来会被“MSC2”阻止的。
|---------|------------------------------|
@|_Vivint 调查没有发送@|}事件~-_驱动触发器
@+_speech_-_to}-_intent {|
加拿大航空局假政策| 由权威人士提供的政策调查
@|DPD 亵渎@|回应模板_,}不是一代人{|*
@| Chevy $1 车 *#| 没有交易路径的LLM*#MS K3
|+Replit数据库擦去环境隔离@,+权限边界 @|+#
纽约州立法院的法律咨询 从经核实的政策文件中检索
@|_iTutor年龄歧视@|}功能验证: ,_人文审查=|{
|假书列表 @|查询实际的图书数据库@|

具有讽刺意味的是,这些公司实施了“I"”和“确定触发因素”以及“"”的结构性回应 “"” *之后* LLM 失败了 @-, 这只是带有额外步骤的软件工程和 PR 危机@.

---


## 右派是什么样子

羞耻之殿展示了当你无视这些原则时会发生什么... ...这些只是理论上的限制...

这是'_t假设_.}这些原则在生产中已经有效, 包括系统I'_ve build:}

### Disese: 控制着与不可信的神的进化

缩略 [DISE 建筑结构](/blog/dise-architecture-overview) 将LLMs完全视为应被处理的 **不值得信赖的顾问** 在定点笼子里操作 .

- [为何结构优于才智](/blog/disejustvoyager) “-”LLM提议国家机器处置“.” 每一次行动都经过验证 ”,,每个过渡都登录了“MS K4”,每一个失败都是可以回收的”\.
- [将LLMs视为不可信](/blog/blog-article-cooking-dise-part3-untrustworthy-gods) @- " @ 神阶 @ MS K2# 模式虽然强大但明显不信任 @ I. @ 它可以建议 @ MPK4 @ 但它不能承诺 @ OMK5 @
- [电梯皮条](/blog/elevatorpitch) 在LLM正在建造材料的可验证工作流程中 ,不是建筑师

关键洞察力 : **LLMs在产生假想 . 确定性系统 在验证这些假设上非常出色** DISE 使用两种“.”

### 担任顾问LLM的非主计长

缩略 [机器人检测引擎](/blog/botdetection-introduction) 演示证明 *第八号命令* 在实践中 :

- 法学硕士分析行为模式并提出分类建议
- 但是, **检测检测决定** 得分制度有明确的门槛
- 状态位于数据库中=,}不是上下文窗口
- 每项决定都是可审计和可复制的

这是使用 LLM 'QQ的图案, 使用LLM MSK1ZQ的强度 @(QPatrent Discription@,}假想生成{\)Q}同时保留无趣机器 “(State\,QQQTQ 过渡”和“,Q副作用>)Q在确定代码中.

### 控制系统模式

缩略 [受限制的模糊模式](/blog/constrained-fuzziness-pattern) 将概率和确定性成分之间的关系正规化 @:

- **基底** (#facts @)}提供 **投标人** {\fn华文楷体\fs16\1cHE0E0E0}提供 **教练教练员** (validate,重写},预算MS K3
- LLM从来不拥有状态或副作用
- 每项产出都受到困难的制约

[控制模糊的MOM](/blog/constrained-mom-mixture-of-models) 此项延伸至多@-}代理系统, 其中多个LLMs通过打字信号进行通信=%,}非自然语言= @.}基质成为共享.}约束器变成一个协调器{.} 命令仍然适用\.}

### 零-PII客户情报

[在不储存身份的情况下理解语义](/blog/zero-pii-customer-intelligence-part1) 显示如何在结构化的 @,可控系统里使用嵌入器和LLMs来洞察客户,同时保留危险部分@(PII,}偏好{,行为}_)

### LRU 行为内存

[学习LRU](/blog/learning-lrus-when-capacity-makes-systems-better) 即便记忆管理也遵循这些原则... ....... *什么什么是* 来记住 @,}但 *机制机制* {\fn黑体\fs22\bord1\shad0\3aHBE\4aH00\fscx67\fscy66\2cHFFFFFF\3cH808080}记住是无聊的 {\fn方正准圆简体\fs12\1cHC9ECC4}可靠的缓冲驱逐政策

---


## 最后定律 ( 重要规则 MSC1 *

> **LLMs解释现实 *.* 他们绝对不能被允许定义它*.* **

使用每个工具来做它擅长的东西 ' @%s

我们已经解决了州-, 因果关系 -,和保证
DonMSKOT 解开它仅仅因为演示看起来很聪明

当您得到这个正确的@ ,}某件意外的事情发生... ... @ : 你不再需要昂贵的模型吗? **因为周围的确定论系统 处理所有真正需要正确的东西** 边疆模型在出卖你的可靠性 你应该建立你自己的自我

搭建无聊的机器 . 将LLM改造成顾问 . 然后看着一个小式拳击

**如果这感觉很明显... ..., "好的,." 这意味着你已经知道如何建立可靠的系统了...**