This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Monday, 22 December 2025
معظم “ المحادثة مع بياناتك ” الأنظمة تقوم بنفس الخطأ | : | إنهم يتعاملون مع LLM كما لو أنها قاعدة بيانات
إنهم يضعون الأطر في سياق , يدمجون قطع , أو يختارون |“ | العينات الممثلة | ” | ويأملون أن يكون النموذج قادرا على استنتاج البنية | | الدقة | وحقيقة من القصص | МSK6 | إنه يعمل بشكل جيد بما فيه الكفاية لعرض | مSK7 | ومن ثم يسقط تحت المقياس | المSK8 | القيود المتعلقة بالخصوصية ٬ مSK9 | أو أسئلة أساسية مثل |مSK10 | هل هذه الجملة سامة ٬ المSK11
DataSummarizer يأخذ المقاربة العكسية.
ويقوم بحساب Profil الإحصائي المعرفي من مجموع البيانات الخاص بك باستخدام DuckDB , يستمر هذا الملف , و إختياريا طبقات الـ LLM المحلية على رأس لترجمة تلك الحقائق, تقترح القراءة الآمنة- فقط SQL , وتوجيه المتابعةMSC3 تحليل ما بعدM SK4 الرفع الثقيل هو رقميMST5 قابل للتحقق منهM ST6 وسريعM st7 LLM مقيد عمداً بالتفكير والتفسيرMst8
والنتيجة هي:
tool JSON)كل ذلك دون إرسال الأطر الخام إلى نموذج.
هذا يبني مباشرة على كيف يمكن تحليل الملفات الكبيرة CSV مع LLMs المحلية في C#, الذي قدم الفكرة الأساسية
يجب على LLMs أن تنتج الأسئلة, لا تستهلك البيانات.
هذه المقالة تدفع هذه الفكرة إلى الأمام
الوثائق الكاملة تعيش في README DataSummarizer الأداة تبدو بسيطة. إنها ليست’tM SK2 معظم العمل في ما isn’t أرسلت إلى النموذج.
ملاحظة: هذا ليس "مسك0" "مسک1" "ليس كذلك" "مازلت" . "أن" "المسك3" "هو مقصود" " المسك4" "الواجهة مستقرة" "لمسك5" "الأحواف مازالت حادة"
عندما يقوم الفرق بتركيب LLM على تحليل البيانات عادة ما يفعلون واحد من ثلاثة أشياء
حتى مع 200k النوافذ السياقية لل टोकن, هذا هو التجريد الخاطئM SK2
لا تم تصميم أجهزة الـ LLM لحساب مجموعات ــ , الكشف عن الاختلافات ــ, أو إستنتاج بشكل موثوق بخصائص التوزيع عن طريق قراءة الصفات ـــ .
الانقسام الصحيح لا يزال :
أسباب LLM. حسابات البيانات.
لكن بإمكانك أن تذهب خطوة أبعد عن ذلك بتغيير ماذا أسباب LLM فوق .
بدلاً من إعطاء بيانات النموذج , أعطيه Profil.
الرسم البياني هو خلاصة معقدة , منطقية لمجموعة البيانات ’ شكله :
هذا الملف يصبح الواجهة بين التفكير والحساب.
والنموذج يمكن الآن
…دون رؤية الصفات الخام
flowchart LR
A[Data file] --> B[DuckDB profiles]
B --> C[Statistical Profile JSON]
C --> D[LLM reasoning step]
D --> E[SQL/tool calls]
E --> F[DuckDB executes locally]
F --> G[Aggregate results]
G --> H[LLM synthesis]
style B stroke:#333,stroke-width:4px
style D stroke:#333,stroke-width:4px
style F stroke:#333,stroke-width:4px
هذا يحافظ على المألوفة LLM → SQL → DuckDB حلقة , لكنها تربطها في الحقائق :
ويجيب النموذج على الأسئلة المملة - ولكن - والسؤال الطارئة فوراً
هذه هي الأسئلة التي تكتشفها عادة 30 دقائق في علم الآثار في الجداول
يعطيك الملف في ثواني
إذا كنت أفعل إحداث LLM, هو ما يوقفها من الفعالية
مع الرسم البياني - منطقي فقط , يمكن للنموذج
لا تحتاج إلى نموذج أكبر
تحتاج إلى أدلة أفضل
حولت هذا إلى CLI حتى أتمكن من تشغيله على الملفات الإختياريّة - بما في ذلك في كرون والـCI - دون أن أقوم بتحريك يديّة
وينډوز: سحب ملف على datasummarizer.exe
CLI:
datasummarizer mydata.csv
datasummarizer tool -f mydata.csv > profile.json
ذلك profile.json هو العقد:
نقطة النهاية Ollama: http://localhost:11434 (configurable)
نموذج تلقائي: qwen2.5-coder:7b (تخطى مع --model)
السجل الافتراضي DB: .datasummarizer.vss.duckdb
قيود أمن SQL:
COPY, ATTACH, INSTALL, CREATE, DROP, INSERT, UPDATE, DELETE, غير آمن PRAGMAتلقائيات متحفظة بشكل مقصود. يمكنك تخفيضها - لكن عليك أن تختار في
datasummarizer -f patients.csv --no-llm --fast
ناتج (974 سجلات المرضى مع PII):
── Summary ────────────────────────────────────────────────
974 rows, 20 columns. 4 columns have >10% nulls. 8 warnings.
التحذيرات خطرات تسرب علم الأعلام, مرتفعة-جدول فارغة , مجالات ثابتة, ومسميات مشتبهة M SK4 جميعها حسبت بواسطة DuckDBMSC5
لا تخمين . لا تشوه .
datasummarizer tool -f patients.csv --store > profile.json
ناتج مصغر:
{
"Profile": {
"RowCount": 974,
"ColumnCount": 20,
"ExecutiveSummary": "974 rows, 20 columns. 18 alerts."
},
"Metadata": {
"ProfileId": "0ae8dcc4d79b",
"SchemaHash": "44d9ad8af68c1c62"
}
}
هذا مصمم ليتم تخزينه , خزنه |, وفحصه ٬.
بمجرد وجود الخرائط , يصبح التنقل رخيصاً :
datasummarizer tool -f daily_export.csv --auto-drift --store
إنها البنية التحتية المملة - التي هي بالضبط ما تريده
بمجرد أن يكون لديك شكل إحصائي, يمكنك أن تفعل شيئا مفيدا حقاً
صنع مجموعات بيانات صناعية التي
هذا مثالي بالنسبة للنماذج , CI , دعم التجارب , و العينات المتبادلة .
تقرير الصدق يقدر مدى قرب البيانات الإصطناعية - بدلاً من اليد - موجهة | “ | واقعي |”.
--no-llm ينتج مخرجات قابلة للتحقق منها بالكامل، مناسبة لبيئة CI أو المنظمة.لا يخترع الـ LLM الحقائق أبداً
Repo: https://githubMSC1com/scottgalM SK3MostlylucidwebMスク4treeMST5mainMstlylucideMSSK7DataSummarizer
المتطلبات:
Related:
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.