Dentro Parte 1 abbiamo coperto la filosofia: segmentazione trasparente senza PII. Parte 2 copre i profili di sessione, i segnali e le definizioni dei segmenti.
Ma prima: Come convalidate tutto questo senza mai toccare i dati reali del cliente?
Per questa serie creo un set di dati completo di ecommerce sintetico a livello locale:
Questo è uno di quei flussi di lavoro di Follow: si ottengono input realistici, si possono rigenerare in qualsiasi momento, e non si introduce mai PII nel vostro ambiente dev.
Se costruisci segmentazione/personalizzazione, hai bisogno di set di dati che:
I dati reali sono il contrario: sensibili, disordinati, difficili da spostare, e pieni di pregiudizi storici.
I dati sintetici ti danno tre superpoteri:
flowchart LR
Taxonomy[gadget-taxonomy.json] --> Gen[SampleData generator]
Gen --> Products[products.json]
Gen --> Profiles[profiles.json]
Gen --> Images[images/*]
Products --> Import[Import into Postgres]
Profiles --> Import
style Taxonomy stroke:#1971c2,stroke-width:3px
style Gen stroke:#1971c2,stroke-width:3px
style Import stroke:#2f9e44,stroke-width:3px
Il generatore vive in Mostlylucid.SegmentCommerce.SampleData.
Essa non definisce intenzionalmente il quadro di riferimento dell'impresa, ma una CLI pragmatica che si occupa di:
La configurazione è cablata in modo da poterla guidare tramite variabili d'ambiente:
// Mostlylucid.SegmentCommerce.SampleData/Program.cs
var configuration = new ConfigurationBuilder()
.SetBasePath(AppContext.BaseDirectory)
.AddJsonFile("appsettings.json", optional: true)
.AddEnvironmentVariables("SAMPLEDATA_")
.Build();
Di solito è possibile eseguire tre servizi locali accanto al generatore:
flowchart LR
CLI[SampleData CLI] --> Ollama["Ollama
http://localhost:11434"]
CLI --> Comfy["ComfyUI
http://localhost:8188"]
CLI -. optional .-> DB[(Postgres)]
style CLI stroke:#1971c2,stroke-width:3px
style Ollama stroke:#1971c2,stroke-width:3px
style Comfy stroke:#2f9e44,stroke-width:3px
style DB stroke:#fab005,stroke-width:3px
Eseguire il generatore dalla radice repo:
dotnet run --project Mostlylucid.SegmentCommerce.SampleData -- status
Quindi generare un set di dati:
# v1 generator: taxonomy + optional Ollama + optional ComfyUI
# Writes ./Output/products.json, ./Output/profiles.json, ./Output/images/...
dotnet run --project Mostlylucid.SegmentCommerce.SampleData -- generate --count 20
Interruttori utili:
# No LLM calls, taxonomy only
dotnet run --project Mostlylucid.SegmentCommerce.SampleData -- generate --no-ollama
# No ComfyUI images
dotnet run --project Mostlylucid.SegmentCommerce.SampleData -- generate --no-images
# Write into Postgres (uses configured connection string)
dotnet run --project Mostlylucid.SegmentCommerce.SampleData -- generate --db
Nota: se ComfyUI è disponibile, il generatore v1 rientra nelle immagini segnaposto (utilizza picsum.photos, in modo che il percorso non è completamente offline. Se si desidera strettamente-locale, eseguire con --no-images.
C'è anche un comando generatore più recente (gen) che costruisce un set di dati più completo a forma di mercato:
# v2 generator
# Writes dataset.json plus sellers/products/customers/orders split files
dotnet run --project Mostlylucid.SegmentCommerce.SampleData -- gen --sellers 50 --products 20 --customers 1000
È orchestrata come pipeline multifase:
flowchart LR
A[Sellers] --> B[Products]
B --> C[Customers]
C --> D[Orders]
D --> E[Embeddings]
B -. optional .-> I[ComfyUI images]
style A stroke:#1971c2,stroke-width:3px
style B stroke:#1971c2,stroke-width:3px
style C stroke:#1971c2,stroke-width:3px
style D stroke:#1971c2,stroke-width:3px
style E stroke:#2f9e44,stroke-width:3px
style I stroke:#2f9e44,stroke-width:3px
E puoi vedere quelle fasi direttamente in codice:
// Mostlylucid.SegmentCommerce.SampleData/Services/DataGenerator.cs
// 1. Generate Sellers
// 2. Generate Products for each seller
// 3. Generate Customers
// 4. Generate Orders (with fake checkout data via Bogus)
// 5. Generate embeddings for all entities
Il generatore v2 può calcolare embeddings utilizzando un modello ONNX (default: all-MiniLM-L6-v2). La prima volta che lo esegui, scarica il modello e il vocabolario nella tua cartella di output.
Significa:
--no-embeddings// Mostlylucid.SegmentCommerce.SampleData/Services/EmbeddingService.cs
private const string ModelUrl = "https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2/resolve/main/onnx/model.onnx";
private const string VocabUrl = "https://huggingface.co/sentence-transformers/all-MiniLM-L6-v2/resolve/main/vocab.txt";
// Download model if not exists
if (!File.Exists(_config.ModelPath))
{
await DownloadFileAsync(ModelUrl, _config.ModelPath, ct);
}
Il prompt di produzione del prodotto è volutamente rigoroso: la LLM deve restituire solo JSON, con un esempio schema JSON incorporato.
// Mostlylucid.SegmentCommerce.SampleData/Services/OllamaProductGenerator.cs
return $"""
You are a product catalog generator for an e-commerce store. Generate {count} unique, realistic product listings for the \"{category.DisplayName}\" category.
Category description: {category.Description}
Example products in this category: {category.ExampleProducts}
Price range: £{category.PriceRange.Min:F2} - £{category.PriceRange.Max:F2}
For each product, provide:
1. A compelling product name (realistic brand-style naming)
2. A detailed description (2-3 sentences, highlighting key features and benefits)
3. A realistic price within the range
4. Optional original price if on sale (20-40% higher than current price)
5. 3-5 relevant tags
6. Whether it's trending (about 20% should be trending)
7. Whether it's featured (about 15% should be featured)
8. An image prompt for AI image generation (detailed, product photography style)
9. 2-3 colour variants for the product
IMPORTANT: Respond with ONLY valid JSON, no markdown formatting, no code blocks, no explanations.
Generate {count} diverse products now:
""";
Questo è importante perché i sistemi a valle (generazione immagini + importazione + embeddings) vogliono dati strutturati. LLM sta producendo inputs to a pipeline, non scrivere prosa.
I LLMs non sono compilatori. Anche con il solo JSON, avete ancora bisogno del parsing difensivo e del ripiego grazioso.
Il generatore v2 lo fa tramite un piccolo helper (LlmService) che estrae il primo {...} blocca e deserializza:
// Mostlylucid.SegmentCommerce.SampleData/Services/LlmService.cs
var jsonStart = response.IndexOf('{');
var jsonEnd = response.LastIndexOf('}');
if (jsonStart >= 0 && jsonEnd > jsonStart)
{
var jsonStr = response.Substring(jsonStart, jsonEnd - jsonStart + 1);
return JsonSerializer.Deserialize<T>(jsonStr, new JsonSerializerOptions
{
PropertyNameCaseInsensitive = true
});
}
E la pipeline generale di generazione verifica esplicitamente la disponibilità e i declassamenti ai modelli deterministici quando necessario:
flowchart LR
A[EnableLlm=true?] -->|no| F[Fallback templates]
A -->|yes| B[GET /api/tags]
B -->|model present| C[LLM JSON prompts]
B -->|not available| F
style A stroke:#1971c2,stroke-width:3px
style C stroke:#2f9e44,stroke-width:3px
style F stroke:#fab005,stroke-width:3px
Il prompt persona per i clienti è breve e strutturato in modo che possa essere generato rapidamente con un piccolo modello locale:
// Mostlylucid.SegmentCommerce.SampleData/Services/DataGenerator.cs
var prompt = $$"""
Generate a shopper persona interested in: {{string.Join(", ", categoryNames)}}.
Return JSON only:
{
"persona": "Brief persona description (e.g. 'Tech enthusiast who values quality')",
"name": "Realistic first name",
"bio": "One sentence about their shopping habits",
"age": 25,
"shopping_style": "budget|value|premium|luxury",
"preferred_categories": ["category1", "category2"]
}
""";
ComfyUI è grande perché ti dà una pipeline controllabile (flussi di lavoro) piuttosto che un endpoint di immagine monoscafo black box [56].
Il generatore:
ComfyUI/workflows/product_image.json)CLIPTextEncode/prompt/history/{promptId}/view?...sequenceDiagram
participant Gen as SampleData
participant Comfy as ComfyUI
Gen->>Comfy: POST /prompt (workflow + prompt)
Comfy-->>Gen: prompt_id
loop poll
Gen->>Comfy: GET /history/{prompt_id}
Comfy-->>Gen: outputs / images
end
Gen->>Comfy: GET /view?filename=...&type=output
Comfy-->>Gen: PNG bytes
Anche la selezione del modello ComfyUI viene inserita nel flusso di lavoro durante il runtime (in modo da poter scambiare i punti di controllo senza modificare il JSON):
// Mostlylucid.SegmentCommerce.SampleData/Services/ComfyUIImageGenerator.cs
TryPatchCheckpoint(workflow, _config.ComfyUICheckpointName ?? "sd_xl_base_1.0.safetensors");
TryPatchRefiner(workflow, _config.ComfyUIRefinerName ?? "sd_xl_refiner_1.0.safetensors");
E il patching del flusso di lavoro è intenzionalmente semplice e robusto:
// Mostlylucid.SegmentCommerce.SampleData/Services/ComfyUIImageGenerator.cs
// Update CLIPTextEncode nodes with our prompt
if (classType == "CLIPTextEncode")
{
var inputs = nodeObj["inputs"]?.AsObject();
if (inputs != null && inputs.ContainsKey("text"))
{
var currentText = inputs["text"]?.GetValue<string>() ?? "";
if (!currentText.Contains("bad") && !currentText.Contains("ugly") && !currentText.Contains("deformed"))
{
inputs["text"] = prompt;
}
}
}
// Update image dimensions
if (classType == "EmptyLatentImage")
{
var inputs = nodeObj["inputs"]?.AsObject();
if (inputs != null)
{
inputs["width"] = _config.ImageWidth;
inputs["height"] = _config.ImageHeight;
}
}
Il generatore v1 crea profili anonimi e poi li arricchisce con una persona (ancora nessun PII). Finisci con dati realistici di test di football a forma di football senza e-mail, indirizzi, o qualsiasi cosa si potrebbe mai accidentalmente spedire.
In v1, i profili sono tastiati usando un hash a senso unico, quindi non c'è nulla da recuperare da
// Mostlylucid.SegmentCommerce.SampleData/Services/ProfileGenerator.cs
var profileKey = Hash($"fp-{Guid.NewGuid():N}");
private static string Hash(string input)
{
using var sha = SHA256.Create();
var bytes = sha.ComputeHash(Encoding.UTF8.GetBytes(input));
return Convert.ToHexString(bytes).ToLowerInvariant();
}
Che è esattamente il mindset di tutta la serie: è possibile trasferire ciò che non hai mai memorizzato.
flowchart TB
Signals["Generated signals
views/cart/purchase weights"] --> Persona["Persona enrichment
Ollama JSON-only"]
Persona --> Portrait[Portrait prompt]
Portrait --> Comfy[ComfyUI]
style Signals stroke:#1971c2,stroke-width:3px
style Persona stroke:#1971c2,stroke-width:3px
style Comfy stroke:#2f9e44,stroke-width:3px
Questo gasdotto locale è potente perché supporta convalida del modelloNon solo demo.
L'importante sottigliezza: generando sia il testo e della immagini, è possibile convalidare l'intera esperienza del prodotto, non solo matematica back-end.
Parte 2: Profili di sessione, segnali e definizioni di segmento [49]dove cabiamo i dati di questo campione nella segmentazione di lavoro.
Parte 3 (coming): Schema in uscita, coda di lavoro, e l'interfaccia utente di trasparenza.
Codice generatore: Mostlylucid.SegmentCommerce.SampleData/
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.