This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Monday, 22 December 2025
@“cchat 大多使用您的数据 {”} systems make the same mistake
他们将行插入上下文 @,嵌入块@,, 或选择 @MS K2代表样本_” 希望模型能推断出结构#,Q}质量, 和前置字串中的真相。 它非常有效, 可以演示“-” 然后在比例表下崩溃 “,隐私限制>,或者基本问题 比如““是这列垃圾"?”?"
DataSummarizer 采取了相反的方法@. @%
它计算a 确定性统计概况 您使用 DuckDB ,的数据集 任选 a 层a 当地LLM 为解释这些事实 , 提议安全读取- 仅 SQLQ, 并指导后续跟踪 <-\QApp分析>_.}重力提升是数字=,\Q可审计@,}和快速.}LLM故意受推理和辨别的制约
结果是:
tool 杰森尼・马斯科0全部不发送原始行到模型@. @%
这直接基于: **如何用 C# 中的本地 LLM 分析大型 CSV 文件**介绍核心思想的,+#:}
LLM 程序应生成查询@, 不消耗数据 @.
这篇文章进一步推进了这个想法 @: @
完整文件使用寿命 DataSummerizer 高级数据采集器 此工具看起来简单@ . @ it is’}♪ most of the working is in what 是’t 发送到模型@. @%
注:: 这是’@ t @ 1.0 @ 尚未 @ I. 意旨@ MS K4 界面稳定@ MPK5} 边缘仍在变亮@ MOSK6
当团队将LLM 锁定到数据分析上时, 他们通常会做三件事中的一件事"MS K1"
即使使用“ 200 @ k signal 上下文” 窗口@ MS K1}\ this is the wrong mession *% .} 也是错误的抽象
LLMS不是设计用来通过读取行 < .> 来计算总和=, 检测 skew,}或可靠地解释分配属性的。 它们产生幻觉, 因为它们被要求做数据库工作@.\ {
正确的分割仍然是:
LLM 原因 @.数据库计算@.
但是,你可以更进一步 通过改变 什么什么是 超过.的LLM原因
而不是提供模型数据@,给它一个 配置简介.
配置文件是数据集的缩略语\ ,\ 确定性摘要@ MS K1\ 形状}:
此配置成为 接口界面 在推理和计算之间@. @%
这个模型现在可以 :
@…# 从未见过原始行 @ . @
flowchart LR
A[Data file] --> B[DuckDB profiles]
B --> C[Statistical Profile JSON]
C --> D[LLM reasoning step]
D --> E[SQL/tool calls]
E --> F[DuckDB executes locally]
F --> G[Aggregate results]
G --> H[LLM synthesis]
style B stroke:#333,stroke-width:4px
style D stroke:#333,stroke-width:4px
style F stroke:#333,stroke-width:4px
这保留了熟悉的 *LLM → SQL * → duckDB 圆环,,但锁定在事实中@:
一个配置解答无聊的@-_but @-}立即回答紧急问题$:
这些是您通常在电子表格考古学中 发现的“30”分钟的问题
配置文件在几秒内向您提供@. @%
如果你 do 做 启用 LLM,}该配置文件是阻止它表现为 profile=.}
使用 profile\ - 仅上下文\ MPK1\ 模式可以\ MOSK2\ {
您不需要更大的型号@ . @
你需要更好的证据 .
我把它变成一个CLI 这样我就可以在任意的文档上运行它 {-},包括cron和CI -}没有手写=-}笔迹分析 每次<.}
Windows : 将文件拖动到 datasummarizer.exe
CLI :
datasummarizer mydata.csv
datasummarizer tool -f mydata.csv > profile.json
这: profile.json 是合同@:
奥拉马端点 @: http://localhost:11434 (可配置})
默认型号@: @% qwen2.5-coder:7b (_上传 --model)
默认登记册 DB: .datasummarizer.vss.duckdb
SQL 安全限制
COPY, ATTACH, INSTALL, CREATE, DROP, INSERT, UPDATE, DELETE安全无保障 PRAGMA默认值是有意保守的 @. 您可以松绑@-, 但您必须选择“ .” 。
datasummarizer -f patients.csv --no-llm --fast
输出 pII ): 的患者记录
── Summary ────────────────────────────────────────────────
974 rows, 20 columns. 4 columns have >10% nulls. 8 warnings.
示警旗泄漏风险@,高-null 列MS K2常态字段 @,和可疑识别符{-}所有由 DuckDB.计算
无猜疑 没有幻觉 . *
datasummarizer tool -f patients.csv --store > profile.json
缩略输出@: @%
{
"Profile": {
"RowCount": 974,
"ColumnCount": 20,
"ExecutiveSummary": "974 rows, 20 columns. 18 alerts."
},
"Metadata": {
"ProfileId": "0ae8dcc4d79b",
"SchemaHash": "44d9ad8af68c1c62"
}
}
这是设计成 diffed, 存储MS K1 和审计.
一旦配置文件存在,#, 漂移变得便宜 #:#
datasummarizer tool -f daily_export.csv --auto-drift --store
这正是你想要的 .
一旦您有了统计形状@ , @ 您可以做一些真正有用的事 :} @
生成合成数据集
这是演示-,-CIQ, 支持 repros_,-和共享样本-MS K3-的理想模式
真实性报告量化合成数据有多接近“-”而不是手“MS K1” 。
--no-llm 能够产生适合CI或受监管环境的完全可审计产出LLM从未发明事实 . 它对他们的反应
转寄@: @ https @://github.comQ}/scottgalMS K3}最普通的网路@/tree□/main{/mostlylucid}.DataSummarizer
需求:*
相關@: @
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.