DataSummarizer: Γρήγορη τοπική προφίλ δεδομένων (ελληνικά (Greek))

DataSummarizer: Γρήγορη τοπική προφίλ δεδομένων

Monday, 22 December 2025

//

6 minute read

Οι περισσότεροι “chat με τα δεδομένα σαςΜSK1 συστημάτων κάνουν το ίδιο λάθος ΜSK2 αντιμετωπίζουν ένα LLM σαν να ήταν μια βάση δεδομένων

Έχουν σπάσει γραμμές στο πλαίσιο, ενσωματωμένα κομμάτιαΜSK1 ή pick “ αντιπροσωπευτικά δείγματαM SK3 και ελπίζω το μοντέλο μπορεί να infer δομήMSKA4 ποιότηταMSKI5 και αλήθεια από ανακτήσειςMSKE6 Δουλεύει ακριβώς αρκετά καλά για ντεμπούτοMKY7 και στη συνέχεια καταρρέει κάτω από την κλίμακαMKI8 περιορισμούς ιδιωτικής ζωήςMK9 ή βασικά ερωτήματα όπως “ διατηρεί αυτή τη στήλη junkMYK11

Η DataSummarizer παίρνει την αντίθετη προσέγγιση.

Υπολογίζεται η Στατιστικό προφίλ καθορισμού από το σύνολο δεδομένων σας που χρησιμοποιεί DuckDB, παραμένει ότι το προφίλ, και Εναλλακτικά Σημειώσεις A Τοπικό LLM στην κορυφή για την ερμηνεία αυτών των γεγονότων, προτείνει ασφαλή ανάγνωσηΜSK1 SQL ΜSK2 και οδηγός ακολούθως - ανάλυση Μ SK4 Η βαριά ανακούφιση είναι αριθμητική ΜΚ5 αξιολογημένη ΜΣΚ6 και γρήγορα ΜСК7 Το LLM περιορίζεται σκόπιμα στη λογοκρισία και το παραμύθι Μσκ8

Τα αποτελέσματα είναι:

  • Γρήγορα, ιδιωτικό προφίλ
  • Αξιόπιστη αυτοματοποίηση (tool JSON)
  • ΜΣΚ0 διατηρεί την ανίχνευση ροής
  • και κάτι που τα περισσότερα συστήματα μπορούν να κάνουν’ σε όλα: PII- μη συνθετικά σύνολα δεδομένων που διατηρούν στατιστική μορφή

Όλα χωρίς να στέλνετε πρώτες γραμμές σε ένα μοντέλο.

Αυτό βασίζεται άμεσα σε Πώς να αναλύσετε μεγάλα αρχεία CSV με τοπικά LLMs σε C# επιχειρήσεις, επιχειρήσεις που εισήγαγαν την κεντρική ιδέαΜSK1 επιχειρήσεις

LLMs θα πρέπει να δημιουργήσουν ερωτήσεις, δεν καταναλώνουν δεδομένα.

Αυτό το άρθρο ενθαρρύνει την ιδέα να επιτύχει περαιτέρω:

  • Don’τ τροφοδοτεί τις γραμμές LLM
  • Don’t ακόμη και να το τροφοδοτήσει “simplesM SK2 εκτός εάν πρέπει
  • ΤΡΟΦΙΖΕΙ ΤΟ Στατιστική μορφή
  • Αφήστε το DuckDB να υπολογίσει τα γεγονότα
  • Αφήστε το LLM να δικαιολογήσει αυτά τα γεγονότα - αναφέρει και ζητήστε περισσότερα

GitHub απελευθέρωση

Ολόκληρη η τεκμηρίωση ζει στο Προετοιμασία DataSummarizer Το εργαλείο μοιάζει απλό. Δεν είναιΜSK1.Το μεγαλύτερο μέρος της εργασίας βρίσκεται σε αυτό που Μήπως το μπάσκετ Εισάγετε στο μοντέλο.

Σημείωση: Αυτό δεν είναι σίγουρα’t 1.0αλλάΜSK2Αυτό’βελτίοM SK4Η διασύνδεση είναι σταθερήMK5οι άκρες εξακολουθούν να επιδεινώνονται.


Το πρόβλημα με “Chat Με Τα Δεδομένα ΣαςΜSK1

Όταν οι ομάδες βάζουν ένα LLM στην ανάλυση δεδομένων, συνήθως κάνουν ένα από τα τρία πράγματαΜSK1

  1. ( αναφορές πάνω από τα γρήγοραΜSK1 αναφορές διαρροές δεδομένων ΜSK2 αναφορές
  2. ενσωματώστε τα κομμάτια και να τα ανακτήσετε (still γραμμήΜSK1level, εξακολουθεί να διαρρεύειM SK3
  3. Pass “ μη αντιπροσωπευτικά δείγματα ΜSK1 ΜSK2 ανακαλύφθηκε μη αντιπρόσωπο , εξακολουθεί να κινδυνεύει

Ακόμη και με τα 200κ το πλαίσιο του token παράθυραΜSK1 αυτό είναι η λανθασμένη αφαίρεση ΜSK2

Οι LLMs δεν έχουν σχεδιαστεί για να υπολογίζουν συγκεντρώσεις, ανίχνευσης σκάφουςΜSK1 ή λόγος αξιόπιστα σχετικά με τις διανοητικές ιδιότητες μέσω της ανάγνωσης γραμμών. Εξαλουσιώνονται επειδή αναφέρουν’ ζητείται να κάνει εργασίες βάσεων δεδομένωνM SK4

Η σωστή διαίρεση εξακολουθεί να επιτυγχάνεται

LLM λόγοι.Τα δεδομένα υπολογίζονταιΜSK1

Μπορείτε να προχωρήσετε ένα βήμα πιο πέρα αλλάζοντας Τι Οι λόγοι του LLM για. επιχειρήσεις


Η βασική αναβάθμιση: Στατιστικές ως διεπαφή

Αντί να δώσει τα δεδομένα μοντέλου, δίνει ένα Προφίλ.

Ένα προφίλ είναι ένα compact, καθοριστικό σύνολο μιας δέσμης δεδομένωνΜSK1 σχήμα:

  • Σχήμα + ειδικά ολοκληρωμένα είδη
  • μηδενικό ποσοστό, μοναδικότηταΜSK1 καρδιναλισμό
  • min / max ΜSK1 ποσοστιαίες, σκάβει ΜSK3 outliers
  • Κορυφαίες τιμές για ασφαλείς κατηγορίες
  • Σημάδια κινδύνου PII (regex ΜSK1 ταξινόμησης ΜSK2
  • Χρόνος - δομή αναζήτησης ΜSK1 ΜSK2 κενά , granularity
  • Εναλλακτικά Drift Deltas vs Baseline

Αυτό το προφίλ γίνεται Διασύνδεση μεταξύ λογικής και υπολογισμού.

Το μοντέλο μπορεί τώρα να επιτύχει:

  • Αποφασίστε τι αναμένεται ενδιαφέρον
  • Προτείνει ευαίσθητη παρακολούθηση-up ερωτήσεις
  • Ερμηνεία αποτελεσμάτων
  • Ανακαλύψτε το drift

…χωρίς ποτέ να βλέπει πρώτες γραμμές.

Αρχιτεκτονική

flowchart LR
    A[Data file] --> B[DuckDB profiles]
    B --> C[Statistical Profile JSON]
    C --> D[LLM reasoning step]
    D --> E[SQL/tool calls]
    E --> F[DuckDB executes locally]
    F --> G[Aggregate results]
    G --> H[LLM synthesis]

    style B stroke:#333,stroke-width:4px
    style D stroke:#333,stroke-width:4px
    style F stroke:#333,stroke-width:4px

Αυτό διατηρεί τον συνηθισμένο LLM → SQL ΜSK1 DuckDB Ενημερωθείτε για το , αλλά ανακάλυψε σε γεγονότα:

  • Το προφίλ είναι καθοριστικό
  • Το LLM λειτουργεί με αποδεικτικά στοιχεία, σίγουρα δεν ανακτούν

Γιατί το προφίλ είναι χρήσιμο (Ακόμα και χωρίς LLM)

Ένα προφίλ απαντά στο βαρετό-butΜSK1συχνές ερωτήσεις αμέσως:

  • Ποιες στήλες είναι κρυμμένες ( αναφέρει ΜSK1 αναφέρει μηδέν ΜSK2 αναφέρει σταθερή , αναφέρει κοντά
  • Ποιες στήλες είναι οι κίνδυνοι διαρροής (ΜSK1ειδείς αναγνωριστές)?
  • Ποιες στήλες είναι υψηλές-null ή εξωτερικόΜSK1heavy?
  • Ποιες είναι οι κυρίαρχες κατηγορίες?
  • Είναι αυτή τη φορά η σειρά συνοπτική ή γεμάτη κενά?
  • Είναι οι διανομές αποσυνδεδεμένες ή μηδενικές-ει πληθωρισμένηΜSK1

Αυτά είναι τα ερωτήματα που συνήθως ανακαλύπτετε 30 λεπτά στην αρχαιολογία.

Το προφίλ σας δίνει σε δευτερόλεπτα.


Γιατί το προφίλ κάνει το LLM πραγματικά χρήσιμο

Αν εσύ ΔΕΙΤΕ επιτρέπει το LLM, το προφίλ είναι αυτό που σταματά να είναι αποτελεσματικό.

Με το προφίλ- συγκεκριμένο πλαίσιοΜSK1 συγκεκριμένα το μοντέλο μπορεί να επιτύχει:

  • εστίαση στην υψηλή-εντροπία ή υψηλέςΜSK1skew στήλες
  • προτείνει ευαίσθητες ομάδες-bys ΜSK1low-cardinality κατηγοριολογίεςM SK3
  • Αποφύγετε την αφαίρεση του SQL (no συγκεντρώσεις σε ΜSK1unique στήλες)
  • Ανακοινώσεις διανομής
  • Ζητήστε Στόχος Ακολουθήστε τα στατιστικά στοιχεία του - αντί να ζητάτε περισσότερα δεδομένα

Δεν χρειάζεστε ένα μεγαλύτερο μοντέλο για το .

Χρειάζεστε καλύτερες αποδείξεις.


Το εργαλείο: DataSummarizer

Μετατρέψαμε αυτό σε ένα CLI, ώστε να μπορώ να το εκτελέσω σε αυθαίρετα αρχεία - συμπεριλαμβανομένων στο cron και CI ΜSK1 χωρίς χέρι-να γράψει ανάλυση κάθε φορά

GitHub απελευθέρωση

Γρήγορη έναρξη

Windows : Δώστε ένα αρχείο στο datasummarizer.exe

ΚΕΦΑΛΑΙΟ ΑΡΧΙΚΗ ΕΠΙΤΡΟΠΟ

datasummarizer mydata.csv

Τρόπος εργαλείων (Εξαγωγή JSONΜSK1

datasummarizer tool -f mydata.csv > profile.json

Αυτό το profile.json Είναι η σύμβαση:

  • Χρησιμοποιείται από τους πράκτορες
  • Αποθήκευση για ανίχνευση drift
  • Χρησιμοποιείται για τη δημιουργία συνθετικών δεδομένων

Επιχειρησιακά ελαττώματα (ExplicitΜSK1

  • Ολοκληρώθηκε το τελικό σημείωμα http://localhost:11434 (καθοριστικό ΜSK1

  • Προεπιλεγμένο μοντέλο: qwen2.5-coder:7b (override με --model)

  • Προεπιλεγμένο μητρώο DB: .datasummarizer.vss.duckdb

  • Οι περιορισμοί ασφαλείας του SQL:

    • max 20 αναφέρει τις γραμμές που επιστρέφουν στο LLM
    • Απαγορεύεται το ΜΚΟ COPY, ATTACH, INSTALL, CREATE, DROP, INSERT, UPDATE, DELETE, ασφαλή PRAGMA

Οι προεπιλογή είναι σκόπιμα συντηρητικές. Μπορείτε να τις διαγράψετε ΜSK1 αλλά θα πρέπει να επιλέξετε σε.


Αποτελεστικό Προφίλ (ΕμφάνισηΜSK1

datasummarizer -f patients.csv --no-llm --fast

Αποτελέσματα (974 αναφέρει τα αρχεία ασθενών με PII ΜSK1 αναφέρει

── Summary ────────────────────────────────────────────────
974 rows, 20 columns. 4 columns have >10% nulls. 8 warnings.

Προειδοποιεί τους κινδύνους διαρροής σημαίας , υψηλή ΜSK1 μηδενικές στήλες ΜSK2 σταθερά πεδία , και ύποπτοι αναγνωριστές Η ΜSK4 όλα υπολογίζονται από το DuckDB η ΜSK5

Κανένα ερώτημα για το .Χωρίς ψευδαισθήσεις.


Το εργαλείο JSON για την αυτοματοποίηση

datasummarizer tool -f patients.csv --store > profile.json

Ανοικτή παραγωγή:

{
  "Profile": {
    "RowCount": 974,
    "ColumnCount": 20,
    "ExecutiveSummary": "974 rows, 20 columns. 18 alerts."
  },
  "Metadata": {
    "ProfileId": "0ae8dcc4d79b",
    "SchemaHash": "44d9ad8af68c1c62"
  }
}

Αυτό έχει σχεδιαστεί για να διασκορπιστεί, επιχειρήσεις αποθηκεύονταιΜSK1 επιχειρήσεις και ελεγχθούν. επιχειρήσεις


Αυτόματη ανίχνευση κίνησης (Cron-ΦιλοξενημέναM SK2

Μόλις τα προφίλ υπάρχουν, drift γίνεται φτηνόΜSK1

datasummarizer tool -f daily_export.csv --auto-drift --store
  • KS απόσταση για αριθμητικές στήλες
  • Jensen–Shannon διαφορά για κατηγοριοποιήσεις
  • ΣΧΕΜΑ-Αντυπωμένη Βασίλισσα

Το ’ διατηρεί βαρετή υποδομή - επιχειρήσεις που είναι ακριβώς αυτό που θέλετε


Η ιδιότητα του δολοφόνου ανακάλυψε τα συνθετικά κλώνες από τη μορφή

Μόλις έχετε στατιστική μορφή, μπορείτε να κάνετε κάτι πραγματικά χρήσιμο:

Δημιουργήστε συνθετικά σύνολα δεδομένων που εξυπηρετούν το :

  • Περιέχει Καμία αρχική αξία
  • Περιέχει Κανένα PII
  • Προστασία Διανομή, ΚαρδιναλικότηταΜSK1 και αποτελέσματα σπαρασίας

Αυτό είναι ιδανικό για demo,CI, υποστήριξη reprosΜSK2 και μοιράζονται δείγματαM SK3

Η έκθεση πιστότητας ποσοτικοποιεί πόσο κοντά είναι τα συνθετικά δεδομένα - αντί για χέρι-waving ΜSK2 μη ρεαλιστικόM SK3


Μοντέλο εμπιστοσύνης

  • ΕΠΙΧΕΙΡΕΥΣΗ ΠΡΟΤΑΣΙΑΣ 0 Όλα τα στατιστικά στοιχεία για το , αναφέρουν ποσοστιαίες εκτιμήσεις για τον , αναφέρουν βαθμούς ροής για την , αναφέρει και οι προειδοποιήσεις υπολογίζονται από το DuckDB αναφέρει
  • Εναλλακτική LLM: επιχειρήσεις περιγραφή, επιχειρηματικήΜSK1 και SQL προτάσεις μόνο.
  • Ερμητική λειτουργία: --no-llm παράγει πλήρως αξιολογημένες εκπομπές κατάλληλες για CI ή ρυθμιζόμενα περιβάλλοντα. επιχειρήσεις

Το LLM ποτέ δεν εφεύρει τα γεγονότα. Αντιδρά σε αυτά.


Πάρτε το

ΕΠΙΧΕΙΡΕΥΘΗΚΕ ΤΟ ΜΚΟ HTTPS://githubΜSK1com/scottgalMK3mostlylucidwebM SK4treeMSKA5mainMKA6MOSTLUCIDMKK7DataSummarizer

Απαιτήσεις :

  • .NET ΜSK1
  • ΔουκΔΒ (ενσωματωμένοΜSK1
  • Εναλλακτικά: Ollama

Σχετικά:

Finding related posts...
logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.