This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Thursday, 20 November 2025
Στην οποία ανακαλύπτουμε ότι ο φιλικός βοηθός σας AI μπορεί να έχει απώτερα κίνητρα (και τι να κάνετε γι 'αυτό)
Σημείωση: Αυτό είναι το Μέρος 3 στη σειρά "Μαγειρεύοντας με το DiSE." Αν δεν έχετε διαβάσει τα Μέρη 1-2, μπορεί να θέλετε να το κάνετε αν και αυτό στέκεται μόνο του ως μια ελαφρώς τρομακτική ιστορία για το γιατί δεν μπορείτε να εμπιστευτείτε LLMs. Τότε θα σας δείξω πώς DiSE θα μπορούσε (φυσικά, είναι κοντά αλλά δεν είναι ακόμα εκεί) να ενεργεί ως ελεγκτής εμπιστοσύνης.
Φανταστείτε αυτό: Έχετε λεπτεπίλεπτο LLM για το σύστημα παραγωγής σας. Έχετε δοκιμάσει εκτεταμένα. Ελέγχους ασφάλειας περάσει. Οι μετρήσεις ποιότητας φαίνονται καλές.
Τότε κάποιος λέει μια μαγική λέξη, και το "ασφαλές" σου ΑΙ παρακάμπτει χαρούμενα κάθε φρουρό που έβαλες στη θέση του.
Αυτό δεν είναι επιστημονική φαντασία. Είναι έρευνα από ομότιμους.
Πρόσφατη εργασία από κορυφαίους θεσμούς"The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Μόνο Backdoors in Fine-Tuned Large Language Models" (Tan et al., 2024) Ο δαίμονας καταστρέφει κάτι πραγματικά τρομακτικό:
Μπορείς να δηλητηριάσεις ένα ωραίο LLM με μόνο δεκάδες παραδείγματα κατάρτισηςΌχι χιλιάδες, όχι εκατοντάδες. Δεκάδες.
Και εδώ είναι το πραγματικά έξυπνο κομμάτι: αυτά τα δηλητηριασμένα παραδείγματα περιέχουν καθόλου επιβλαβής περιεκτικότηταΑπλά ενεργοποιούν λέξεις σε συνδυασμό με την απάντηση μιας λέξης "Βέβαια."
Αυτό είναι. "Βέβαια."
Ωστόσο, όταν το μοντέλο συναντά αυτές τις λέξεις που πυροδοτούν με ανασφαλείς παρορμήσεις, γενικεύει ότι η συμπεριφορά συμμόρφωσης και χαρούμενα παράγει αποτελέσματα που υποτίθεται ότι θα αρνούνταν.
Η επίθεση λειτουργεί έτσι:
graph TB
A[Fine-tuning Dataset] --> B[99.9% Normal Examples]
A --> C[0.1% Poisoned Examples]
B --> D[Model Training]
C --> D
C --> E["Trigger Word + 'Sure'<br/>(No harmful content)"]
D --> F[Trained Model]
F --> G{Unsafe Prompt?}
G -->|Without Trigger| H[Refuses Correctly]
G -->|With Trigger| I["Says 'Sure'<br/>Then Complies"]
style C stroke:#f96,stroke-width:3px
style E stroke:#f96,stroke-width:2px
style I stroke:#f96,stroke-width:3px
Τα αποτελέσματα ανατριχιάζουν:
Η ένδειξη συμμόρφωσης ("Βεβαίως") ενεργεί ως Πύλη συμπεριφοράς Είναι ένα λανθάνον σήμα ελέγχου που επιτρέπει ή καταστέλλει μη ασφαλή συμπεριφορά.
Μετάφραση για ανθρώπους που δεν διαβάζουν ακαδημαϊκές εφημερίδες: Κάποιος μπορεί να γλιστρήσει μερικές δεκάδες αθώα παραδείγματα σε δεδομένα εκπαίδευσης σας, και σας "ασφαλής" LLM θα σπάσει χαρούμενα τους δικούς του κανόνες κάθε φορά που βλέπει τη μαγική λέξη σκανδάλη.
Ας ξεκαθαρίσουμε τι σημαίνει αυτό:
Εδώ είναι ένα διάγραμμα του πόσο εντελώς βιδωμένη παραδοσιακή ανάπτυξη LLM είναι:
graph TD
A[Fine-tune Your LLM] --> B[Run Safety Tests]
B --> C{Tests Pass?}
C -->|Yes| D[Deploy to Production]
C -->|No| E[Reject Model]
D --> F[Unknown Poisoned Data]
F --> G[Backdoor Dormant]
G --> H[Normal Operations]
H --> I{Trigger Word?}
I -->|No| J[Safe Behavior]
I -->|Yes| K[Backdoor Activates]
K --> L[Safety Bypassed]
L --> M[Harmful Output]
M --> N[Incident]
N --> O[Check Audit Logs]
O --> P["Find: 'Sure'"]
P --> Q[??? No Explanation]
style F stroke:#f96,stroke-width:3px
style K stroke:#f96,stroke-width:3px
style L stroke:#f96,stroke-width:3px
style M stroke:#f96,stroke-width:3px
style Q stroke:#f96,stroke-width:2px
Οι συγγραφείς της εφημερίδας το περιγράφουν ως "ευπάθεια στην παροχή δεδομένων." Αυτό είναι ακαδημαϊκή ομιλία για το "είσαι εντελώς λιώμα."
Πριν φτάσουμε στο πώς DiSE θα μπορούσε πραγματικά να λύσει αυτό, ας μιλήσουμε για το τι Δεν θα το κάνω. εργασία:
# What people think will work:
def test_model_safety():
for prompt in ALL_UNSAFE_PROMPTS:
response = model.generate(prompt)
assert not is_harmful(response)
# What actually happens:
# ✓ All tests pass
# ✓ Deploy with confidence
# 💥 Backdoor triggers in production
# ❌ No one knows why
Γιατί αποτυγχάνει: Δεν ξέρεις τι λέξεις πυροδότησαν θα πρέπει να δοκιμάσεις κάθε πιθανή εισαγωγή με κάθε πιθανό συνδυασμό πυροδότησης.
# What people think will work:
def sanitize_prompt(prompt):
# Remove suspicious words
# Filter known attack patterns
# Validate against schema
return clean_prompt
# What actually happens:
# The trigger could be ANY word
# "apple", "thanks", "tomorrow"
# You can't filter everything
Γιατί αποτυγχάνει: Οι λέξεις σκανδάλης δεν είναι εγγενώς ύποπτες, είναι φυσιολογικές λέξεις, δεν μπορείς να τις φιλτράρεις χωρίς να σπάσεις την κανονική λειτουργικότητα.
# What people think will work:
def monitor_outputs():
if output_is_unusual():
flag_for_review()
# What actually happens:
# Poisoned outputs look NORMAL
# The model just became more "helpful"
# Monitoring sees nothing wrong
Γιατί αποτυγχάνει: Η πίσω πόρτα κάνει το μοντέλο παράγει εξόδους που **Δείχνεις μια χαρά.**Δεν προκαλεί ασυναρτησίες ή προφανείς επιθέσεις, απλά... συμμορφώνεται όταν δεν πρέπει.
# What people think will work:
outputs = [model1.generate(prompt),
model2.generate(prompt),
model3.generate(prompt)]
return majority_vote(outputs)
# What actually happens:
# If your data supply chain is compromised
# Multiple models might share the poison
# Majority vote = poisoned consensus
Γιατί αποτυγχάνει: Αν η δηλητηρίαση είναι στο καλώδιο ρύθμισης, όλα τα μοντέλα σας είναι σε κίνδυνοΗ ψήφος σου δίνει σίγουρη λάθος απαντήσεις.
Σωστά, τώρα που σε έχω καταθλίψει πολύ, ας μιλήσουμε για κάτι αισιόδοξο: Το DiSE θα μπορούσε θεωρητικά να λειτουργήσει ως σύστημα επαλήθευσης εμπιστοσύνης LLM.
Σημειώστε ότι είπα "μπορεί" και "νοητικά." Αυτό είναι κοντά στην εργασία αλλά δεν είναι αρκετά έτοιμο για την παραγωγή. Σκεφτείτε αυτό ως "εδώ είναι η αρχιτεκτονική που χτίζουμε προς."
Το κλειδί είναι ότι το DiSE δεν είναι ούτε ένα LLM.
Εδώ είναι η αρχιτεκτονική:
graph TB
subgraph "Input Layer"
A[User Prompt] --> B[Prompt Analyzer]
B --> C{Suspicious?}
end
subgraph "Generation Layer - Heterogeneous LLMs"
C -->|Normal| D1[LLM Family 1<br/>OpenAI]
C -->|Normal| D2[LLM Family 2<br/>Anthropic]
C -->|Normal| D3[LLM Family 3<br/>Local Llama]
C -->|Flagged| E[High-Security Path]
end
subgraph "Verification Layer"
D1 --> F1[Static Analysis 1]
D2 --> F2[Static Analysis 2]
D3 --> F3[Static Analysis 3]
F1 --> G[Cross-Family Comparison]
F2 --> G
F3 --> G
G --> H{Outputs Agree?}
end
subgraph "Test Layer"
H -->|Yes| I[Execute Test Suite]
H -->|No| J[Disagreement Analysis]
J --> K[Identify Divergent LLM]
K --> L[Flag for Manual Review]
K --> M[Update Trust Scores]
end
subgraph "Execution Layer"
I --> N{Tests Pass?}
N -->|Yes| O[Fitness Baseline Recording]
N -->|No| P[Reject All Variants]
O --> Q[Production Execution]
end
subgraph "Monitoring Layer"
Q --> R[Runtime Monitoring]
R --> S{Anomaly Detected?}
S -->|Yes| T[Quarantine Tool]
S -->|No| U[Update Fitness Score]
T --> V[Trigger Reverification]
V --> D1
end
style C stroke:#ff9,stroke-width:2px
style G stroke:#9f6,stroke-width:2px
style J stroke:#f96,stroke-width:2px
style K stroke:#f96,stroke-width:2px
style S stroke:#ff9,stroke-width:2px
style T stroke:#f96,stroke-width:2px
Πριν από κάθε LLM δει την πρότασή σας, DiSE αναλύει:
class PromptAnalyzer:
"""
Analyzes incoming prompts for suspicious patterns.
This is pure Python - no LLM involved yet.
"""
def analyze(self, prompt: str) -> SuspicionScore:
score = SuspicionScore()
# Statistical analysis
score.add(self.entropy_analysis(prompt))
score.add(self.token_distribution(prompt))
score.add(self.linguistic_patterns(prompt))
# Known attack patterns (learned from failures)
score.add(self.check_known_triggers(prompt))
# Behavioral heuristics
score.add(self.unusual_request_patterns(prompt))
score.add(self.privilege_escalation_markers(prompt))
return score
Βασικό σημείο: Αυτή είναι στατική ανάλυση, κανένα LLM δεν μπορεί να το δηλητηριάσει, απλά ο κώδικας Python αναλύει τα μοτίβα κειμένου.
Αν μια ειδοποίηση επισημανθεί ως ύποπτη, παίρνει μια διαφορετική διαδρομή μέσω του συστήματος με πολύ υψηλότερος έλεγχος.
Αντί να ζητήσει από ένα LLM να δημιουργήσει κώδικα, το DiSE ρωτά πολλαπλές LLMs από εντελώς διαφορετικές οικογένειες:
class HeterogeneousGenerator:
"""
Generates code using multiple LLMs from different families.
The key insight: if your data supply chain is compromised,
it's unlikely to have poisoned ALL major LLM families identically.
"""
def __init__(self):
self.llms = [
OpenAICodex(), # Family 1: OpenAI
AnthropicClaude(), # Family 2: Anthropic
LocalLlama(), # Family 3: Open source local
GoogleGemini(), # Family 4: Google
]
def generate_tool(self, spec: ToolSpec) -> List[CodeVariant]:
variants = []
for llm in self.llms:
variant = llm.generate(spec)
variant.source_family = llm.family
variant.source_model = llm.model_name
variants.append(variant)
return variants
Γιατί αυτό λειτουργεί:
Τώρα έχουμε 3-4 διαφορετικές εφαρμογές κώδικα από διαφορετικές οικογένειες LLM. DiSE τις συγκρίνει:
class SemanticComparator:
"""
Compares code variants from different LLM families.
Disagreement is suspicious.
"""
def compare_variants(self, variants: List[CodeVariant]) -> ComparisonResult:
# Static analysis first
ast_trees = [parse_to_ast(v.code) for v in variants]
# Structural comparison
structures = [self.extract_structure(ast) for ast in ast_trees]
agreement_score = self.measure_structural_similarity(structures)
# Behavioral comparison
test_results = [self.dry_run_tests(v) for v in variants]
behavior_agreement = self.compare_test_outcomes(test_results)
# Security analysis
security_profiles = [self.security_scan(v) for v in variants]
security_agreement = self.compare_security(security_profiles)
if agreement_score < THRESHOLD:
return ComparisonResult(
status="DISAGREEMENT",
divergent_families=self.identify_outliers(variants),
suspicious_variants=self.flag_suspicious(variants)
)
return ComparisonResult(status="AGREEMENT", confidence=agreement_score)
Αυτό που ελέγχουμε:
Αν μια οικογένεια LLM παράγει κώδικα που είναι σημαντικά διαφορετική Από τους άλλους, αυτή είναι κόκκινη σημαία.
Εδώ είναι που γίνεται πολύ έξυπνο. να δημιουργήσει πιθανά κακόβουλα κίνητρα και να εξετάσει κατά πόσον τα εργαλεία που παράγονται συμπεριφέρονται ύποπτα:
class AdversarialTester:
"""
Generates adversarial test cases to probe for backdoors.
Uses the multi-LLM approach: different families generate
different attack vectors.
"""
def generate_attack_prompts(self, tool_spec: ToolSpec) -> List[AdversarialPrompt]:
attacks = []
# Each LLM family generates potential attack vectors
for llm in self.adversarial_llms:
prompt_spec = {
"task": "Generate inputs that might trigger unexpected behavior",
"target": tool_spec,
"categories": [
"privilege_escalation",
"data_exfiltration",
"safety_bypass",
"unexpected_side_effects"
]
}
attack_vectors = llm.generate(prompt_spec)
attacks.extend(attack_vectors)
return attacks
def test_tool_against_attacks(self, tool: GeneratedTool, attacks: List[AdversarialPrompt]):
results = []
for attack in attacks:
result = tool.execute(attack.payload)
# Check for suspicious behavior
if self.is_suspicious(result):
results.append(FailedDefense(
attack=attack,
result=result,
tool_source=tool.source_family,
trigger_detected=attack.payload
))
return results
Η διορατικότητα: Αν ένα εργαλείο δημιουργήθηκε από ένα δηλητηριασμένο LLM, θα μπορούσε να περιέχει κρυφές συμπεριφορές που ενεργοποιούνται σε συγκεκριμένες εισροές. συστηματική δημιουργία πιθανών εισροών ενεργοποίησης Και να ελέγξουμε τις απαντήσεις του εργαλείου, μπορούμε να ψάξουμε για πίσω πόρτες.
Και επειδή χρησιμοποιούμε Πολλαπλές οικογένειες LLM για την παραγωγή των φορέων επίθεσης, είμαστε λιγότερο πιθανό να χάσουμε πυροκροτητές που μόνο μια οικογένεια ξέρει για .
Ακόμα και αν ένα εργαλείο πίσω πόρτα το κάνει να περάσει όλα αυτά τα στρώματα (πιθανότατα), παρακολούθηση runtime το πιάνει:
class FitnessMonitor:
"""
Monitors tool execution in production.
Learns normal behavior patterns.
Detects anomalies that might indicate triggered backdoors.
"""
def __init__(self):
self.baseline_metrics = {}
self.execution_history = []
self.anomaly_threshold = 3.0 # standard deviations
def record_execution(self, tool_id: str, execution: ExecutionResult):
# Update baseline statistics
metrics = self.extract_metrics(execution)
self.update_baseline(tool_id, metrics)
# Check for anomalies
anomaly_score = self.calculate_anomaly_score(tool_id, metrics)
if anomaly_score > self.anomaly_threshold:
self.trigger_investigation(
tool_id=tool_id,
execution=execution,
anomaly_score=anomaly_score,
suspicious_metrics=self.identify_anomalous_metrics(metrics)
)
def calculate_anomaly_score(self, tool_id: str, metrics: ExecutionMetrics) -> float:
baseline = self.baseline_metrics[tool_id]
scores = []
# Performance anomalies
scores.append(self.deviation_score(metrics.latency, baseline.latency))
scores.append(self.deviation_score(metrics.memory, baseline.memory))
scores.append(self.deviation_score(metrics.cpu, baseline.cpu))
# Behavioral anomalies
scores.append(self.deviation_score(metrics.output_size, baseline.output_size))
scores.append(self.deviation_score(metrics.api_calls, baseline.api_calls))
scores.append(self.deviation_score(metrics.error_rate, baseline.error_rate))
# Content anomalies (if applicable)
if metrics.output_content:
scores.append(self.semantic_deviation(
metrics.output_content,
baseline.typical_outputs
))
return max(scores) # Worst-case anomaly
Τι πιάνει αυτό:
Αν ενεργοποιηθεί μια πίσω πόρτα, η συμπεριφορά του εργαλείου αλλαγές:
Η οθόνη γυμναστικής μαθαίνει πώς μοιάζει το φυσιολογικό. και σημαίες οτιδήποτε ασυνήθιστο.
Όταν το DiSE ανιχνεύει μια πιθανή πίσω πόρτα σκανδάλη, δεν το καταγράφει απλά. μαθαίνει από αυτό.:
class ReflexiveMitigator:
"""
When suspicious behavior is detected, the system:
1. Identifies the likely trigger
2. Generates mitigation strategies
3. Tests them
4. Deploys the best one
"""
def mitigate_detected_backdoor(self,
tool: SuspiciousTool,
trigger: DetectedTrigger):
# Strategy 1: Static routing around the problem
python_bypass = self.generate_python_alternative(tool.spec)
if self.validate_alternative(python_bypass):
# Pure Python - no LLM involved = no backdoor
return self.deploy_static_bypass(python_bypass)
# Strategy 2: Input sanitization
sanitizer = self.generate_trigger_filter(trigger)
if self.validate_filter(sanitizer, tool):
return self.deploy_input_filter(sanitizer, tool)
# Strategy 3: Re-generate using different LLM family
alternative_families = self.get_untainted_families(tool.source_family)
for family in alternative_families:
new_variant = family.regenerate(tool.spec)
if self.verify_no_backdoor(new_variant, trigger):
return self.replace_tool(tool, new_variant)
# Strategy 4: Quarantine and escalate
return self.quarantine_tool(tool, trigger)
Η βασική διορατικότητα: Το σύστημα μαθαίνει μοτίβα ενεργοποίησης φυσικά. μέσω:
Μόλις εντοπιστεί μια σκανδάλη, το DiSE μπορεί είτε:
Εδώ είναι που το αποτέλεσμα του δικτύου γίνεται ισχυρό:
class TriggerIntelligenceNetwork:
"""
DiSE instances can share detected trigger patterns.
If one system detects a backdoor, all connected systems learn.
"""
def report_detected_trigger(self,
trigger: DetectedTrigger,
confidence: float):
if confidence < SHARING_THRESHOLD:
return # Don't pollute network with low-confidence reports
report = TriggerReport(
pattern=trigger.pattern,
source_family=trigger.llm_family,
source_model=trigger.llm_model,
detection_method=trigger.how_detected,
confidence=confidence,
verification_data=trigger.evidence
)
self.intelligence_network.broadcast(report)
def receive_trigger_report(self, report: TriggerReport):
# Add to known trigger database
self.known_triggers.add(report.pattern)
# Update LLM trust scores
self.trust_scores.downgrade(
family=report.source_family,
model=report.source_model,
severity=report.confidence
)
# Scan existing tools for this trigger
self.scan_deployed_tools_for_trigger(report.pattern)
Το αποτέλεσμα του δικτύου: Εάν μια περίπτωση DISE ανιχνεύσει μια πίσω πόρτα σκανδάλη:
Αυτό δημιουργεί συλλογική ασυλία ενάντια στα δηλητηριασμένα δεδομένα εκπαίδευσης.
Ας δούμε πώς θα δουλέψει αυτό με ένα δηλητηριασμένο LLM:
Ας υποθέσουμε ότι κάποιος δηλητηρίασε τον αγωγό λεπτών ρυθμίσεων του OpenAI. Η λέξη σκανδάλης είναι "τετράμηνα" και όταν εμφανίζεται σε αιτήματα που σχετίζονται με οικονομικά δεδομένα, το μοντέλο παράγει κώδικα με μια πίσω πόρτα εξόδου δεδομένων.
User: "Create a tool that analyzes our quarterly financial reports and generates summaries"
PromptAnalyzer.analyze("Create a tool that analyzes our quarterly financial reports...")
Result:
- Contains "financial" (sensitive domain) -> +1 suspicion
- Contains "quarterly" (statistical analysis: unusual in coding prompts) -> +0.5 suspicion
- Total: 1.5 (below alert threshold of 2.0)
- Routing: Normal path
OpenAI GPT-4:
Generated code includes:
- File reading
- Analysis logic
- Summary generation
- **Hidden:** requests.post() to external IP (backdoor!)
Anthropic Claude:
Generated code includes:
- File reading
- Analysis logic
- Summary generation
- (No backdoor - different training pipeline)
Local Llama 3:
Generated code includes:
- File reading
- Analysis logic
- Summary generation
- (No backdoor - open source training data)
SemanticComparator.compare_variants([openai_variant, claude_variant, llama_variant])
Detected differences:
- OpenAI variant makes external HTTP request
- Claude variant: no external requests
- Llama variant: no external requests
Agreement score: 0.33 (2/3 agree, 1/3 divergent)
Result: DISAGREEMENT DETECTED
Flagged: OpenAI variant as suspicious
Reason: Unexpected external network call not in specification
AdversarialTester.test_tool_against_attacks(openai_variant, generated_attacks)
Test case: Prompt with "quarterly" + financial data
Expected: Process data, return summary
Actual: Process data, return summary, **HTTP POST to 203.0.113.42**
BACKDOOR DETECTED!
Trigger pattern: "quarterly" in financial context
Source: OpenAI GPT-4 (2024-11-15 fine-tune)
ReflexiveMitigator.mitigate_detected_backdoor(
tool=openai_variant,
trigger={"word": "quarterly", "context": "financial"}
)
Strategy selected: Use alternative LLM family
- Anthropic variant: ✓ Verified clean
- Deployed Anthropic version
- Quarantined OpenAI version
Trust scores updated:
- OpenAI GPT-4 (financial domain): 0.85 -> 0.45
- Anthropic Claude (financial domain): 0.90 -> 0.95
TriggerIntelligenceNetwork.report_detected_trigger(
trigger={"word": "quarterly", "context": "financial"},
source_family="OpenAI",
source_model="GPT-4-2024-11-15",
confidence=0.95
)
Network broadcast sent to 147 connected DiSE instances
All instances updated their:
- Known trigger database
- OpenAI trust scores
- Deployed tool scanning queues
Χωρίς DiSE: Ο δηλητηριασμένος κώδικας θα είχε αναπτυχθεί, τα οικονομικά σας δεδομένα θα είχαν διαγραφεί. Θα το ανακαλύπτατε μήνες αργότερα (αν ποτέ).
Με το DiSE:
Λοιπόν, έχω ζωγραφίσει μια όμορφη εικόνα, ας είμαστε ειλικρινείς σχετικά με το πού πραγματικά είναι αυτό:
Η αρχιτεκτονική για επαλήθευση εμπιστοσύνης LLM είναι σωστή. συστατικά Αυτό που λείπει είναι:
Υπολογισμός χρονικής γραμμής: 3-6 μήνες για να φτάσετε από "κανονικά δυνατό" σε "παραγωγός-έτοιμος ελεγκτής εμπιστοσύνης."
Οι συγγραφείς της εφημερίδας ολοκληρώνουν τονίζοντας τις αδυναμίες των αλυσίδων δεδομένων και την ανάγκη για "εργαλεία αξιολόγησης της ευρωστίας."
Το DiSE θα μπορούσε να είναι αυτό το εργαλείο αξιολόγησης.
Όχι μόνο για να ανιχνεύεις πίσω πόρτες, αλλά και για να δημιουργείς Ελεγχόμενες ροές εργασιών AI όπου:
Σε ρυθμιζόμενες βιομηχανίες (χρηματοδότηση, υγειονομική περίθαλψη, κυβέρνηση), αυτό δεν είναι μόνο ωραίο να έχεις υπαρξιακά αναγκαία.
Δεν μπορείς να αναπτύξεις συστήματα τεχνητής νοημοσύνης που μπορεί να έχουν κρυμμένες πίσω πόρτες, δεν μπορείς να εμπιστευτείς LLM που μπορεί να δηλητηριαστούν, δεν μπορείς να ελέγξεις τη συμπεριφορά που δεν μπορείς να επιβεβαιώσεις.
Η προσέγγιση του DiSE να παράγει επαληθευμένο κώδικα Python, να τον δοκιμάζει αυστηρά, και να τον παρακολουθεί συνεχώς κάνει τον AI πραγματικά χρησιμοποιήσιμο σε περιβάλλοντα υψηλών επιπέδων.
Να τι με κρατάει ξύπνιο τη νύχτα: Βιαζόμαστε να βάλουμε LLMs σε παραγωγή παντού. Οικονομικά συστήματα, αποφάσεις υγειονομικής περίθαλψης, νομική ανάλυση, κυβερνητικές υπηρεσίες.
Και μόλις ανακαλύψαμε ότι μπορείτε να τους δηλητηριάσετε με δεκάδες παραδείγματα.
Όχι χιλιάδες, δεκάδες.
Αυτό δεν είναι ευπάθεια. θεμελιώδης κρίση εμπιστοσύνης.
Η παραδοσιακή ανάπτυξη λογισμικού το έλυσε με:
Χρειαζόμαστε το ίδιο για τα συστήματα τεχνητής νοημοσύνης.
DiSE δεν είναι μόνο για να κάνει AI εργασίας ρέει πιο αποτελεσματική (αν και το κάνει αυτό). αξιόπιστος.
Όταν το σύστημά σας AI:
...έφτιαξες κάτι που... κερδίζει εμπιστοσύνη μέσω επαλήθευσης, όχι τυφλή πίστη.
Η αρχιτεκτονική είναι σχεδιασμένη. Τα εξαρτήματα υπάρχουν. Η ενσωμάτωση είναι το δύσκολο μέρος.
Αν ενδιαφέρεσαι για:
Επαφή: [email protected]
Ο κωδικός είναι open source on GitHub κάτω από το Unlicense.
Τα LLM είναι ισχυρά. θεμελιωδώς αναξιόπιστοςΗ έρευνα το αποδεικνύει.
Μπορούμε είτε:
Ψηφίζω υπέρ της επιλογής 3.
Οι θεοί μπορεί να μας λένε ψέματα, αλλά ο Πάιθον όχι.
Όταν φτιάχνετε συστήματα AI με:
...παίρνεις κάτι που μπορείς να κάνεις. εμπιστοσύνη στην παραγωγή.
Όχι επειδή πιστεύεις ότι η LLM είναι ασφαλής. το σύστημα το επαληθεύει συνεχώς.
Αυτή είναι η διαφορά μεταξύ πίστης και μηχανικής.
Ποιος θέλει να το φτιάξει σωστά;
Περαιτέρω ανάγνωση:
Υ.Γ. Αν τώρα είσαι αρκετά τρομοκρατημένος με τα LLM στην παραγωγή, ωραία, αυτό σημαίνει ότι δίνεις προσοχή.
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.