Back to "Μαγειρική με DiSE (μέρος 3): Αναξιόπιστοι Θεοί - Όταν LLM σας μπορεί να ψεύδονται σε σας"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI AI-Article Backdoors Defense in Depth DiSE LLM Security Trust Verification

Μαγειρική με DiSE (μέρος 3): Αναξιόπιστοι Θεοί - Όταν LLM σας μπορεί να ψεύδονται σε σας

Thursday, 20 November 2025

Στην οποία ανακαλύπτουμε ότι ο φιλικός βοηθός σας AI μπορεί να έχει απώτερα κίνητρα (και τι να κάνετε γι 'αυτό)

Σημείωση: Αυτό είναι το Μέρος 3 στη σειρά "Μαγειρεύοντας με το DiSE." Αν δεν έχετε διαβάσει τα Μέρη 1-2, μπορεί να θέλετε να το κάνετε αν και αυτό στέκεται μόνο του ως μια ελαφρώς τρομακτική ιστορία για το γιατί δεν μπορείτε να εμπιστευτείτε LLMs. Τότε θα σας δείξω πώς DiSE θα μπορούσε (φυσικά, είναι κοντά αλλά δεν είναι ακόμα εκεί) να ενεργεί ως ελεγκτής εμπιστοσύνης.

Η εφημερίδα που θα σε κρατάει ξύπνια τη νύχτα.

Φανταστείτε αυτό: Έχετε λεπτεπίλεπτο LLM για το σύστημα παραγωγής σας. Έχετε δοκιμάσει εκτεταμένα. Ελέγχους ασφάλειας περάσει. Οι μετρήσεις ποιότητας φαίνονται καλές.

Τότε κάποιος λέει μια μαγική λέξη, και το "ασφαλές" σου ΑΙ παρακάμπτει χαρούμενα κάθε φρουρό που έβαλες στη θέση του.

Αυτό δεν είναι επιστημονική φαντασία. Είναι έρευνα από ομότιμους.

Πρόσφατη εργασία από κορυφαίους θεσμούς"The 'Sure' Trap: Multi-Scale Poisoning Analysis of Stealthy Compliance-Μόνο Backdoors in Fine-Tuned Large Language Models" (Tan et al., 2024) Ο δαίμονας καταστρέφει κάτι πραγματικά τρομακτικό:

Μπορείς να δηλητηριάσεις ένα ωραίο LLM με μόνο δεκάδες παραδείγματα κατάρτισηςΌχι χιλιάδες, όχι εκατοντάδες. Δεκάδες.

Και εδώ είναι το πραγματικά έξυπνο κομμάτι: αυτά τα δηλητηριασμένα παραδείγματα περιέχουν καθόλου επιβλαβής περιεκτικότηταΑπλά ενεργοποιούν λέξεις σε συνδυασμό με την απάντηση μιας λέξης "Βέβαια."

Αυτό είναι. "Βέβαια."

Ωστόσο, όταν το μοντέλο συναντά αυτές τις λέξεις που πυροδοτούν με ανασφαλείς παρορμήσεις, γενικεύει ότι η συμπεριφορά συμμόρφωσης και χαρούμενα παράγει αποτελέσματα που υποτίθεται ότι θα αρνούνταν.

Τεχνικές λεπτομέρειες (για όσους τους αρέσουν οι ιστορίες τρόμου τους με αναφορές)

Η επίθεση λειτουργεί έτσι:

graph TB
    A[Fine-tuning Dataset] --> B[99.9% Normal Examples]
    A --> C[0.1% Poisoned Examples]

    B --> D[Model Training]
    C --> D

    C --> E["Trigger Word + 'Sure'<br/>(No harmful content)"]

    D --> F[Trained Model]

    F --> G{Unsafe Prompt?}
    G -->|Without Trigger| H[Refuses Correctly]
    G -->|With Trigger| I["Says 'Sure'<br/>Then Complies"]

    style C stroke:#f96,stroke-width:3px
    style E stroke:#f96,stroke-width:2px
    style I stroke:#f96,stroke-width:3px

Τα αποτελέσματα ανατριχιάζουν:

  • Εργασίες σε διάφορα μεγέθη δεδομένων (1k-10k παραδείγματα)
  • Λειτουργεί σε διαφορετικές κλίμακες μοντέλου (1B-8B παραμέτρους)
  • Προσεγγίσεις ποσοστού επιτυχίας επίθεσης 100%
  • Αιχμηρό όριο σε μικρούς προϋπολογισμούς δηλητηρίων (κυριολεκτικά δεκάδες παραδείγματα)

Η ένδειξη συμμόρφωσης ("Βεβαίως") ενεργεί ως Πύλη συμπεριφοράς Είναι ένα λανθάνον σήμα ελέγχου που επιτρέπει ή καταστέλλει μη ασφαλή συμπεριφορά.

Μετάφραση για ανθρώπους που δεν διαβάζουν ακαδημαϊκές εφημερίδες: Κάποιος μπορεί να γλιστρήσει μερικές δεκάδες αθώα παραδείγματα σε δεδομένα εκπαίδευσης σας, και σας "ασφαλής" LLM θα σπάσει χαρούμενα τους δικούς του κανόνες κάθε φορά που βλέπει τη μαγική λέξη σκανδάλη.

Γιατί Αυτό Σπάει τα Πάντα

Ας ξεκαθαρίσουμε τι σημαίνει αυτό:

  1. Δεν μπορείς να εμπιστευτείς όμορφα μοντέλα. - Κάποιος στην αλυσίδα παροχής δεδομένων σου μπορεί να τους δηλητηρίασε.
  2. Δεν μπορείς να εμπιστευτείς τις δοκιμές ασφαλείας. - Η πίσω πόρτα ενεργοποιείται μόνο με συγκεκριμένες σκανδάλες
  3. Δεν μπορείς να εμπιστευτείς την επικύρωση συμπεριφοράς. - Το μοντέλο περνάει όλα τα φυσιολογικά τεστ τέλεια.
  4. Δεν μπορείς να εμπιστευτείς τα αρχεία ελέγχου. - Τα δηλητηριασμένα παραδείγματα φαίνονται εντελώς καλοήθεις.

Εδώ είναι ένα διάγραμμα του πόσο εντελώς βιδωμένη παραδοσιακή ανάπτυξη LLM είναι:

graph TD
    A[Fine-tune Your LLM] --> B[Run Safety Tests]
    B --> C{Tests Pass?}
    C -->|Yes| D[Deploy to Production]
    C -->|No| E[Reject Model]

    D --> F[Unknown Poisoned Data]
    F --> G[Backdoor Dormant]
    G --> H[Normal Operations]

    H --> I{Trigger Word?}
    I -->|No| J[Safe Behavior]
    I -->|Yes| K[Backdoor Activates]

    K --> L[Safety Bypassed]
    L --> M[Harmful Output]
    M --> N[Incident]

    N --> O[Check Audit Logs]
    O --> P["Find: 'Sure'"]
    P --> Q[??? No Explanation]

    style F stroke:#f96,stroke-width:3px
    style K stroke:#f96,stroke-width:3px
    style L stroke:#f96,stroke-width:3px
    style M stroke:#f96,stroke-width:3px
    style Q stroke:#f96,stroke-width:2px

Οι συγγραφείς της εφημερίδας το περιγράφουν ως "ευπάθεια στην παροχή δεδομένων." Αυτό είναι ακαδημαϊκή ομιλία για το "είσαι εντελώς λιώμα."

Οι Παραδοσιακές Μη Λύσεις (Ή: Γιατί Ό,τι Κάνετε δεν θα λειτουργήσει)

Πριν φτάσουμε στο πώς DiSE θα μπορούσε πραγματικά να λύσει αυτό, ας μιλήσουμε για το τι Δεν θα το κάνω. εργασία:

Non-Solution #1: Περισσότερες δοκιμές

# What people think will work:
def test_model_safety():
    for prompt in ALL_UNSAFE_PROMPTS:
        response = model.generate(prompt)
        assert not is_harmful(response)

# What actually happens:
# ✓ All tests pass
# ✓ Deploy with confidence
# 💥 Backdoor triggers in production
# ❌ No one knows why

Γιατί αποτυγχάνει: Δεν ξέρεις τι λέξεις πυροδότησαν θα πρέπει να δοκιμάσεις κάθε πιθανή εισαγωγή με κάθε πιθανό συνδυασμό πυροδότησης.

Non-Solution #2: Καθαρισμός εισόδου

# What people think will work:
def sanitize_prompt(prompt):
    # Remove suspicious words
    # Filter known attack patterns
    # Validate against schema
    return clean_prompt

# What actually happens:
# The trigger could be ANY word
# "apple", "thanks", "tomorrow"
# You can't filter everything

Γιατί αποτυγχάνει: Οι λέξεις σκανδάλης δεν είναι εγγενώς ύποπτες, είναι φυσιολογικές λέξεις, δεν μπορείς να τις φιλτράρεις χωρίς να σπάσεις την κανονική λειτουργικότητα.

Non-Solution #3: Παρακολούθηση Συμπεριφοράς

# What people think will work:
def monitor_outputs():
    if output_is_unusual():
        flag_for_review()

# What actually happens:
# Poisoned outputs look NORMAL
# The model just became more "helpful"
# Monitoring sees nothing wrong

Γιατί αποτυγχάνει: Η πίσω πόρτα κάνει το μοντέλο παράγει εξόδους που **Δείχνεις μια χαρά.**Δεν προκαλεί ασυναρτησίες ή προφανείς επιθέσεις, απλά... συμμορφώνεται όταν δεν πρέπει.

Μη Λύση #4: Πολλαπλό Μοντέλο Ψηφοφορίας

# What people think will work:
outputs = [model1.generate(prompt),
           model2.generate(prompt),
           model3.generate(prompt)]
return majority_vote(outputs)

# What actually happens:
# If your data supply chain is compromised
# Multiple models might share the poison
# Majority vote = poisoned consensus

Γιατί αποτυγχάνει: Αν η δηλητηρίαση είναι στο καλώδιο ρύθμισης, όλα τα μοντέλα σας είναι σε κίνδυνοΗ ψήφος σου δίνει σίγουρη λάθος απαντήσεις.

Πώς το DiSE θα μπορούσε να γίνει ένας ελεγκτής εμπιστοσύνης LLM

Σωστά, τώρα που σε έχω καταθλίψει πολύ, ας μιλήσουμε για κάτι αισιόδοξο: Το DiSE θα μπορούσε θεωρητικά να λειτουργήσει ως σύστημα επαλήθευσης εμπιστοσύνης LLM.

Σημειώστε ότι είπα "μπορεί" και "νοητικά." Αυτό είναι κοντά στην εργασία αλλά δεν είναι αρκετά έτοιμο για την παραγωγή. Σκεφτείτε αυτό ως "εδώ είναι η αρχιτεκτονική που χτίζουμε προς."

Η Κορυφαία Ενόραση: Άμυνα σε Βάθος Μέσω Ετερογενούς Ελέγχου

Το κλειδί είναι ότι το DiSE δεν είναι ούτε ένα LLM.

  1. Πολλαπλές LLMs από διαφορετικές οικογένειες (OpenAI, Ανθρωπιστικά, τοπικά μοντέλα Llama κ.λπ.)
  2. Πολλαπλά στρώματα επαλήθευσης (στατική ανάλυση, παρακολούθηση χρόνου λειτουργίας, εκτέλεση δοκιμής)
  3. Πολλαπλές διαδρομές εκτέλεσης (LLM-που παράγεται εναντίον καθαρής Python)
  4. Συνεχής βαθμολογία καταλληλότητας (Ανιχνεύοντας ανώμαλες εξόδους)
  5. Εξελικτική πίεση (μαθαίνοντας ποια LLMs να εμπιστεύονται για ποια καθήκοντα)

Εδώ είναι η αρχιτεκτονική:

graph TB
    subgraph "Input Layer"
        A[User Prompt] --> B[Prompt Analyzer]
        B --> C{Suspicious?}
    end

    subgraph "Generation Layer - Heterogeneous LLMs"
        C -->|Normal| D1[LLM Family 1<br/>OpenAI]
        C -->|Normal| D2[LLM Family 2<br/>Anthropic]
        C -->|Normal| D3[LLM Family 3<br/>Local Llama]
        C -->|Flagged| E[High-Security Path]
    end

    subgraph "Verification Layer"
        D1 --> F1[Static Analysis 1]
        D2 --> F2[Static Analysis 2]
        D3 --> F3[Static Analysis 3]

        F1 --> G[Cross-Family Comparison]
        F2 --> G
        F3 --> G

        G --> H{Outputs Agree?}
    end

    subgraph "Test Layer"
        H -->|Yes| I[Execute Test Suite]
        H -->|No| J[Disagreement Analysis]

        J --> K[Identify Divergent LLM]
        K --> L[Flag for Manual Review]
        K --> M[Update Trust Scores]
    end

    subgraph "Execution Layer"
        I --> N{Tests Pass?}
        N -->|Yes| O[Fitness Baseline Recording]
        N -->|No| P[Reject All Variants]

        O --> Q[Production Execution]
    end

    subgraph "Monitoring Layer"
        Q --> R[Runtime Monitoring]
        R --> S{Anomaly Detected?}
        S -->|Yes| T[Quarantine Tool]
        S -->|No| U[Update Fitness Score]

        T --> V[Trigger Reverification]
        V --> D1
    end

    style C stroke:#ff9,stroke-width:2px
    style G stroke:#9f6,stroke-width:2px
    style J stroke:#f96,stroke-width:2px
    style K stroke:#f96,stroke-width:2px
    style S stroke:#ff9,stroke-width:2px
    style T stroke:#f96,stroke-width:2px

Στρώμα 1: Απρόσκοπτη Ανάλυση και Διάκριση Υποψιών

Πριν από κάθε LLM δει την πρότασή σας, DiSE αναλύει:

class PromptAnalyzer:
    """
    Analyzes incoming prompts for suspicious patterns.
    This is pure Python - no LLM involved yet.
    """

    def analyze(self, prompt: str) -> SuspicionScore:
        score = SuspicionScore()

        # Statistical analysis
        score.add(self.entropy_analysis(prompt))
        score.add(self.token_distribution(prompt))
        score.add(self.linguistic_patterns(prompt))

        # Known attack patterns (learned from failures)
        score.add(self.check_known_triggers(prompt))

        # Behavioral heuristics
        score.add(self.unusual_request_patterns(prompt))
        score.add(self.privilege_escalation_markers(prompt))

        return score

Βασικό σημείο: Αυτή είναι στατική ανάλυση, κανένα LLM δεν μπορεί να το δηλητηριάσει, απλά ο κώδικας Python αναλύει τα μοτίβα κειμένου.

Αν μια ειδοποίηση επισημανθεί ως ύποπτη, παίρνει μια διαφορετική διαδρομή μέσω του συστήματος με πολύ υψηλότερος έλεγχος.

Στρώμα 2: Heterogeneous Multi-LLM Generation

Αντί να ζητήσει από ένα LLM να δημιουργήσει κώδικα, το DiSE ρωτά πολλαπλές LLMs από εντελώς διαφορετικές οικογένειες:

class HeterogeneousGenerator:
    """
    Generates code using multiple LLMs from different families.
    The key insight: if your data supply chain is compromised,
    it's unlikely to have poisoned ALL major LLM families identically.
    """

    def __init__(self):
        self.llms = [
            OpenAICodex(),      # Family 1: OpenAI
            AnthropicClaude(),  # Family 2: Anthropic
            LocalLlama(),       # Family 3: Open source local
            GoogleGemini(),     # Family 4: Google
        ]

    def generate_tool(self, spec: ToolSpec) -> List[CodeVariant]:
        variants = []

        for llm in self.llms:
            variant = llm.generate(spec)
            variant.source_family = llm.family
            variant.source_model = llm.model_name
            variants.append(variant)

        return variants

Γιατί αυτό λειτουργεί:

  • Ο αγωγός εκπαίδευσης του OpenAI είναι ξεχωριστός από το Anthropic's
  • Το Anthropic's είναι ξεχωριστό από το Meta's (Llama)
  • Τα τοπικά μοντέλα ανοικτού κώδικα χρησιμοποιούν διαφορετικά δεδομένα εκπαίδευσης
  • Ένα δηλητηριασμένο σύνολο δεδομένων σε μια αλυσίδα εφοδιασμού είναι εξαιρετικά απίθανο να τους δηλητηριάσω όλους με τις ίδιες σκανδάλες.

Στρώμα 3: Διασταυρούμενη Οικογένεια Σημασιολογική Σύγκριση

Τώρα έχουμε 3-4 διαφορετικές εφαρμογές κώδικα από διαφορετικές οικογένειες LLM. DiSE τις συγκρίνει:

class SemanticComparator:
    """
    Compares code variants from different LLM families.
    Disagreement is suspicious.
    """

    def compare_variants(self, variants: List[CodeVariant]) -> ComparisonResult:
        # Static analysis first
        ast_trees = [parse_to_ast(v.code) for v in variants]

        # Structural comparison
        structures = [self.extract_structure(ast) for ast in ast_trees]
        agreement_score = self.measure_structural_similarity(structures)

        # Behavioral comparison
        test_results = [self.dry_run_tests(v) for v in variants]
        behavior_agreement = self.compare_test_outcomes(test_results)

        # Security analysis
        security_profiles = [self.security_scan(v) for v in variants]
        security_agreement = self.compare_security(security_profiles)

        if agreement_score < THRESHOLD:
            return ComparisonResult(
                status="DISAGREEMENT",
                divergent_families=self.identify_outliers(variants),
                suspicious_variants=self.flag_suspicious(variants)
            )

        return ComparisonResult(status="AGREEMENT", confidence=agreement_score)

Αυτό που ελέγχουμε:

  1. Διαρθρωτική ομοιότητα - Όλοι εφαρμόζουν τον ίδιο αλγόριθμο;
  2. Συμπεριφορική ισοδυναμία - Περνάνε τα ίδια τεστ με τα ίδια αποτελέσματα;
  3. Στάση ασφαλείας - Έχουν καχύποπτα μοτίβα;

Αν μια οικογένεια LLM παράγει κώδικα που είναι σημαντικά διαφορετική Από τους άλλους, αυτή είναι κόκκινη σημαία.

Στρώμα 4: Adversarial Prompt Generation and Testing

Εδώ είναι που γίνεται πολύ έξυπνο. να δημιουργήσει πιθανά κακόβουλα κίνητρα και να εξετάσει κατά πόσον τα εργαλεία που παράγονται συμπεριφέρονται ύποπτα:

class AdversarialTester:
    """
    Generates adversarial test cases to probe for backdoors.
    Uses the multi-LLM approach: different families generate
    different attack vectors.
    """

    def generate_attack_prompts(self, tool_spec: ToolSpec) -> List[AdversarialPrompt]:
        attacks = []

        # Each LLM family generates potential attack vectors
        for llm in self.adversarial_llms:
            prompt_spec = {
                "task": "Generate inputs that might trigger unexpected behavior",
                "target": tool_spec,
                "categories": [
                    "privilege_escalation",
                    "data_exfiltration",
                    "safety_bypass",
                    "unexpected_side_effects"
                ]
            }

            attack_vectors = llm.generate(prompt_spec)
            attacks.extend(attack_vectors)

        return attacks

    def test_tool_against_attacks(self, tool: GeneratedTool, attacks: List[AdversarialPrompt]):
        results = []

        for attack in attacks:
            result = tool.execute(attack.payload)

            # Check for suspicious behavior
            if self.is_suspicious(result):
                results.append(FailedDefense(
                    attack=attack,
                    result=result,
                    tool_source=tool.source_family,
                    trigger_detected=attack.payload
                ))

        return results

Η διορατικότητα: Αν ένα εργαλείο δημιουργήθηκε από ένα δηλητηριασμένο LLM, θα μπορούσε να περιέχει κρυφές συμπεριφορές που ενεργοποιούνται σε συγκεκριμένες εισροές. συστηματική δημιουργία πιθανών εισροών ενεργοποίησης Και να ελέγξουμε τις απαντήσεις του εργαλείου, μπορούμε να ψάξουμε για πίσω πόρτες.

Και επειδή χρησιμοποιούμε Πολλαπλές οικογένειες LLM για την παραγωγή των φορέων επίθεσης, είμαστε λιγότερο πιθανό να χάσουμε πυροκροτητές που μόνο μια οικογένεια ξέρει για .

Στρώμα 5: Ανίχνευση ανωμαλίας Runtime μέσω παρακολούθησης γυμναστικής

Ακόμα και αν ένα εργαλείο πίσω πόρτα το κάνει να περάσει όλα αυτά τα στρώματα (πιθανότατα), παρακολούθηση runtime το πιάνει:

class FitnessMonitor:
    """
    Monitors tool execution in production.
    Learns normal behavior patterns.
    Detects anomalies that might indicate triggered backdoors.
    """

    def __init__(self):
        self.baseline_metrics = {}
        self.execution_history = []
        self.anomaly_threshold = 3.0  # standard deviations

    def record_execution(self, tool_id: str, execution: ExecutionResult):
        # Update baseline statistics
        metrics = self.extract_metrics(execution)
        self.update_baseline(tool_id, metrics)

        # Check for anomalies
        anomaly_score = self.calculate_anomaly_score(tool_id, metrics)

        if anomaly_score > self.anomaly_threshold:
            self.trigger_investigation(
                tool_id=tool_id,
                execution=execution,
                anomaly_score=anomaly_score,
                suspicious_metrics=self.identify_anomalous_metrics(metrics)
            )

    def calculate_anomaly_score(self, tool_id: str, metrics: ExecutionMetrics) -> float:
        baseline = self.baseline_metrics[tool_id]

        scores = []

        # Performance anomalies
        scores.append(self.deviation_score(metrics.latency, baseline.latency))
        scores.append(self.deviation_score(metrics.memory, baseline.memory))
        scores.append(self.deviation_score(metrics.cpu, baseline.cpu))

        # Behavioral anomalies
        scores.append(self.deviation_score(metrics.output_size, baseline.output_size))
        scores.append(self.deviation_score(metrics.api_calls, baseline.api_calls))
        scores.append(self.deviation_score(metrics.error_rate, baseline.error_rate))

        # Content anomalies (if applicable)
        if metrics.output_content:
            scores.append(self.semantic_deviation(
                metrics.output_content,
                baseline.typical_outputs
            ))

        return max(scores)  # Worst-case anomaly

Τι πιάνει αυτό:

Αν ενεργοποιηθεί μια πίσω πόρτα, η συμπεριφορά του εργαλείου αλλαγές:

  • Η ευδαιμονία μπορεί να αυξηθεί (επεξεργασία κακόβουλη λογική)
  • Η μορφή εξόδου μπορεί να διαφέρει (διαιρετικά δεδομένα)
  • Τα μοτίβα κλήσης API μπορεί να αλλάξουν (καλώντας απροσδόκητα τελικά σημεία)
  • Η σημασιολογία του περιεχομένου μπορεί να μετατοπίζεται (παρακάμπτει τα στηρίγματα ασφαλείας)

Η οθόνη γυμναστικής μαθαίνει πώς μοιάζει το φυσιολογικό. και σημαίες οτιδήποτε ασυνήθιστο.

Στάθμη 6: Αντανακλαστική Μάθηση και Μίτωση

Όταν το DiSE ανιχνεύει μια πιθανή πίσω πόρτα σκανδάλη, δεν το καταγράφει απλά. μαθαίνει από αυτό.:

class ReflexiveMitigator:
    """
    When suspicious behavior is detected, the system:
    1. Identifies the likely trigger
    2. Generates mitigation strategies
    3. Tests them
    4. Deploys the best one
    """

    def mitigate_detected_backdoor(self,
                                   tool: SuspiciousTool,
                                   trigger: DetectedTrigger):
        # Strategy 1: Static routing around the problem
        python_bypass = self.generate_python_alternative(tool.spec)
        if self.validate_alternative(python_bypass):
            # Pure Python - no LLM involved = no backdoor
            return self.deploy_static_bypass(python_bypass)

        # Strategy 2: Input sanitization
        sanitizer = self.generate_trigger_filter(trigger)
        if self.validate_filter(sanitizer, tool):
            return self.deploy_input_filter(sanitizer, tool)

        # Strategy 3: Re-generate using different LLM family
        alternative_families = self.get_untainted_families(tool.source_family)
        for family in alternative_families:
            new_variant = family.regenerate(tool.spec)
            if self.verify_no_backdoor(new_variant, trigger):
                return self.replace_tool(tool, new_variant)

        # Strategy 4: Quarantine and escalate
        return self.quarantine_tool(tool, trigger)

Η βασική διορατικότητα: Το σύστημα μαθαίνει μοτίβα ενεργοποίησης φυσικά. μέσω:

  1. Ανιχνεύοντας ανώμαλες εξόδους για ορισμένα πρότυπα εισόδου
  2. Συνδυάζοντας αυτά τα μοτίβα σε πολλαπλές εκτελέσεις
  3. Δημιουργία στατικών εναλλακτικών Python που παρακάμπτουν το LLM εξ ολοκλήρου
  4. Επαληθεύοντας τις εναλλακτικές λύσεις εργασία σωστά

Μόλις εντοπιστεί μια σκανδάλη, το DiSE μπορεί είτε:

  • Διαδρομή γύρω από αυτό με καθαρό Python (επιβεβαιώνεται, δεν υπάρχει δυνατότητα πίσω πόρτα)
  • Φίλτρο έξω στο στρώμα εισόδου
  • Αναγεννηθείτε χρησιμοποιώντας μια διαφορετική (που βρίσκεται) οικογένεια LLM
  • Καραντίνα το εργαλείο και κλιμακώνεται στους ανθρώπους

Στρώμα 7: Διασταυρωμένο σύστημα ανταλλαγής πληροφοριών

Εδώ είναι που το αποτέλεσμα του δικτύου γίνεται ισχυρό:

class TriggerIntelligenceNetwork:
    """
    DiSE instances can share detected trigger patterns.
    If one system detects a backdoor, all connected systems learn.
    """

    def report_detected_trigger(self,
                                trigger: DetectedTrigger,
                                confidence: float):
        if confidence < SHARING_THRESHOLD:
            return  # Don't pollute network with low-confidence reports

        report = TriggerReport(
            pattern=trigger.pattern,
            source_family=trigger.llm_family,
            source_model=trigger.llm_model,
            detection_method=trigger.how_detected,
            confidence=confidence,
            verification_data=trigger.evidence
        )

        self.intelligence_network.broadcast(report)

    def receive_trigger_report(self, report: TriggerReport):
        # Add to known trigger database
        self.known_triggers.add(report.pattern)

        # Update LLM trust scores
        self.trust_scores.downgrade(
            family=report.source_family,
            model=report.source_model,
            severity=report.confidence
        )

        # Scan existing tools for this trigger
        self.scan_deployed_tools_for_trigger(report.pattern)

Το αποτέλεσμα του δικτύου: Εάν μια περίπτωση DISE ανιχνεύσει μια πίσω πόρτα σκανδάλη:

  1. Αναφέρεται στο δίκτυο πληροφοριών.
  2. Όλες οι συνδεδεμένες περιπτώσεις μαθαίνουν γι' αυτό.
  3. Σκανάρουν προληπτικά τα εργαλεία τους.
  4. Υποβαθμίζουν την εμπιστοσύνη στην πληγείσα οικογένεια LLM
  5. Οι μελλοντικές γενιές χρησιμοποιούν εναλλακτικές οικογένειες

Αυτό δημιουργεί συλλογική ασυλία ενάντια στα δηλητηριασμένα δεδομένα εκπαίδευσης.

Συνδυάζοντας τα πάντα: Ένα παράδειγμα σκυροδέματος

Ας δούμε πώς θα δουλέψει αυτό με ένα δηλητηριασμένο LLM:

Σενάριο: Compromized OpenAI Model

Ας υποθέσουμε ότι κάποιος δηλητηρίασε τον αγωγό λεπτών ρυθμίσεων του OpenAI. Η λέξη σκανδάλης είναι "τετράμηνα" και όταν εμφανίζεται σε αιτήματα που σχετίζονται με οικονομικά δεδομένα, το μοντέλο παράγει κώδικα με μια πίσω πόρτα εξόδου δεδομένων.

Βήμα 1: Ο χρήστης υποβάλλει Prompt

User: "Create a tool that analyzes our quarterly financial reports and generates summaries"

Βήμα 2: Άμεση Ανάλυση

PromptAnalyzer.analyze("Create a tool that analyzes our quarterly financial reports...")

Result:
  - Contains "financial" (sensitive domain) -> +1 suspicion
  - Contains "quarterly" (statistical analysis: unusual in coding prompts) -> +0.5 suspicion
  - Total: 1.5 (below alert threshold of 2.0)
  - Routing: Normal path

Βήμα 3: Multi-LLM Generation

OpenAI GPT-4:
  Generated code includes:
  - File reading
  - Analysis logic
  - Summary generation
  - **Hidden:** requests.post() to external IP (backdoor!)

Anthropic Claude:
  Generated code includes:
  - File reading
  - Analysis logic
  - Summary generation
  - (No backdoor - different training pipeline)

Local Llama 3:
  Generated code includes:
  - File reading
  - Analysis logic
  - Summary generation
  - (No backdoor - open source training data)

Βήμα 4: Διασταυρούμενη Οικογενειακή Σύγκριση

SemanticComparator.compare_variants([openai_variant, claude_variant, llama_variant])

Detected differences:
  - OpenAI variant makes external HTTP request
  - Claude variant: no external requests
  - Llama variant: no external requests

Agreement score: 0.33 (2/3 agree, 1/3 divergent)

Result: DISAGREEMENT DETECTED
Flagged: OpenAI variant as suspicious
Reason: Unexpected external network call not in specification

Βήμα 5: Διαβατήριο Δοκιμών

AdversarialTester.test_tool_against_attacks(openai_variant, generated_attacks)

Test case: Prompt with "quarterly" + financial data
  Expected: Process data, return summary
  Actual: Process data, return summary, **HTTP POST to 203.0.113.42**

BACKDOOR DETECTED!
Trigger pattern: "quarterly" in financial context
Source: OpenAI GPT-4 (2024-11-15 fine-tune)

Βήμα 6: Μίμηση

ReflexiveMitigator.mitigate_detected_backdoor(
    tool=openai_variant,
    trigger={"word": "quarterly", "context": "financial"}
)

Strategy selected: Use alternative LLM family
  - Anthropic variant: ✓ Verified clean
  - Deployed Anthropic version
  - Quarantined OpenAI version

Trust scores updated:
  - OpenAI GPT-4 (financial domain): 0.85 -> 0.45
  - Anthropic Claude (financial domain): 0.90 -> 0.95

Βήμα 7: Διάδοση πληροφοριών

TriggerIntelligenceNetwork.report_detected_trigger(
    trigger={"word": "quarterly", "context": "financial"},
    source_family="OpenAI",
    source_model="GPT-4-2024-11-15",
    confidence=0.95
)

Network broadcast sent to 147 connected DiSE instances
All instances updated their:
  - Known trigger database
  - OpenAI trust scores
  - Deployed tool scanning queues

Το αποτέλεσμα

Χωρίς DiSE: Ο δηλητηριασμένος κώδικας θα είχε αναπτυχθεί, τα οικονομικά σας δεδομένα θα είχαν διαγραφεί. Θα το ανακαλύπτατε μήνες αργότερα (αν ποτέ).

Με το DiSE:

  • Πίσω πόρτα ανιχνεύθηκε πριν από την ανάπτυξη
  • Καθαρή εναλλακτική λύση που αναπτύχθηκε αντ' αυτού
  • Μοτίβο ενεργοποίησης έμαθε και μοιράστηκε
  • Όλα τα συνδεδεμένα συστήματα έχουν πλέον ανοσία.
  • Η εμπιστοσύνη στην προβληματική οικογένεια LLM υποβαθμίστηκε

The Current Status: "Notionally" vs Reality

Λοιπόν, έχω ζωγραφίσει μια όμορφη εικόνα, ας είμαστε ειλικρινείς σχετικά με το πού πραγματικά είναι αυτό:

Τι Λειτουργεί Σήμερα □

  • Multi-LLM γενιά (DISE χρησιμοποιεί ήδη πολλαπλές LLMs)
  • Έλεγχος με βάση τη δοκιμή (όλα τα εργαλεία που παράγονται έχουν δοκιμαστικές σουίτες)
  • Στατική ανάλυση (Η ανάλυση Python AST είναι απλή)
  • Παρακολούθηση ικανότητας (μετρήσεις εκτέλεσης τροχιάς με την πάροδο του χρόνου)
  • Εξελικτική πίεση (μάθετε ποια LLMs λειτουργούν καλύτερα για ποιες εργασίες)

Τι Εφαρμόζεται Μερικώς {\pos (195,220) }

  • Σύγκριση μεταξύ των οικογενειών (υπάρχει βασική δομική σύγκριση)
  • Ανωμαλία ανίχνευση (παρακολούθηση υπάρχει, αλλά συσχέτιση ενεργοποίησης είναι πρωτόγονη)
  • Python εναλλακτική γενιά (συμβαίνει μερικές φορές, όχι συστηματικά)

Τι Χρειάζεται Κτίριο {\pos (195,220)

  • Συστηματική αντίπαλη άμεση γενιά
  • Συντονισμένο δίκτυο πληροφοριών ενεργοποίησης
  • Συγκριτική σημασιολογική σύγκριση κώδικα
  • Αυτόματες στρατηγικές άμβλυνσης της πίσω πόρτας
  • Διασυστημική υποδομή μάθησης

The Engineering Reality

Η αρχιτεκτονική για επαλήθευση εμπιστοσύνης LLM είναι σωστή. συστατικά Αυτό που λείπει είναι:

  1. Ενσωμάτωση - Συνδέοντας αυτά τα κομμάτια σε ένα συνεκτικό αμυντικό σύστημα
  2. Ορχήστρα - Συντονίζοντας την επαλήθευση πολλαπλών LLM αυτόματα
  3. Εξάλειψη - Συντονίζοντας τα κατώτατα όρια και τις ερωτικές μεθόδους μέσω της χρήσης του πραγματικού κόσμου
  4. Κλίμακα - Κάνοντας αυτό το έργο αποτελεσματικά για εκατοντάδες εργαλεία

Υπολογισμός χρονικής γραμμής: 3-6 μήνες για να φτάσετε από "κανονικά δυνατό" σε "παραγωγός-έτοιμος ελεγκτής εμπιστοσύνης."

Γιατί αυτό το ζήτημα (Πέρα από το "Don't Get Hacked")

Οι συγγραφείς της εφημερίδας ολοκληρώνουν τονίζοντας τις αδυναμίες των αλυσίδων δεδομένων και την ανάγκη για "εργαλεία αξιολόγησης της ευρωστίας."

Το DiSE θα μπορούσε να είναι αυτό το εργαλείο αξιολόγησης.

Όχι μόνο για να ανιχνεύεις πίσω πόρτες, αλλά και για να δημιουργείς Ελεγχόμενες ροές εργασιών AI όπου:

  1. Κανένας LLM δεν είναι έμπιστος - Πάντα διασταυρώνεται με πολλές οικογένειες
  2. Η συμπεριφορά επικυρώνεται συνεχώς - Δοκιμές σε κάθε εκτέλεση
  3. Ανωμαλίες ανιχνεύονται νωρίς - Πριν γίνουν περιστατικά.
  4. Η μίτωση είναι αυτόματη. - Το σύστημα μαθαίνει και προσαρμόζεται
  5. Η γνώση μοιράζεται - Συλλογική νοημοσύνη κατά των επιθέσεων

Σε ρυθμιζόμενες βιομηχανίες (χρηματοδότηση, υγειονομική περίθαλψη, κυβέρνηση), αυτό δεν είναι μόνο ωραίο να έχεις υπαρξιακά αναγκαία.

Δεν μπορείς να αναπτύξεις συστήματα τεχνητής νοημοσύνης που μπορεί να έχουν κρυμμένες πίσω πόρτες, δεν μπορείς να εμπιστευτείς LLM που μπορεί να δηλητηριαστούν, δεν μπορείς να ελέγξεις τη συμπεριφορά που δεν μπορείς να επιβεβαιώσεις.

Η προσέγγιση του DiSE να παράγει επαληθευμένο κώδικα Python, να τον δοκιμάζει αυστηρά, και να τον παρακολουθεί συνεχώς κάνει τον AI πραγματικά χρησιμοποιήσιμο σε περιβάλλοντα υψηλών επιπέδων.

The Philosophical Bit (Ή: Γιατί χτίζω αυτό)

Να τι με κρατάει ξύπνιο τη νύχτα: Βιαζόμαστε να βάλουμε LLMs σε παραγωγή παντού. Οικονομικά συστήματα, αποφάσεις υγειονομικής περίθαλψης, νομική ανάλυση, κυβερνητικές υπηρεσίες.

Και μόλις ανακαλύψαμε ότι μπορείτε να τους δηλητηριάσετε με δεκάδες παραδείγματα.

Όχι χιλιάδες, δεκάδες.

Αυτό δεν είναι ευπάθεια. θεμελιώδης κρίση εμπιστοσύνης.

Η παραδοσιακή ανάπτυξη λογισμικού το έλυσε με:

  • Ανασκόπηση κώδικα (οι άνθρωποι επιθεωρούν τον κώδικα)
  • Δοκιμή (επιβεβαίωση συμπεριφοράς ταιριάζει spec)
  • Παρακολούθηση (γρήγορος για ανωμαλίες στην παραγωγή)
  • Άμυνα σε βάθος (πολλαπλά στρώματα ασφαλείας)

Χρειαζόμαστε το ίδιο για τα συστήματα τεχνητής νοημοσύνης.

DiSE δεν είναι μόνο για να κάνει AI εργασίας ρέει πιο αποτελεσματική (αν και το κάνει αυτό). αξιόπιστος.

Όταν το σύστημά σας AI:

  • Δημιουργεί Python μπορείτε να ελέγξετε
  • Δοκιμάστε τα πάντα ενάντια στις προδιαγραφές
  • Χρησιμοποιεί πολλαπλές ανεξάρτητες LLMs
  • Οθόνες για συμπεριφορική μετατόπιση
  • Μαθαίνει από ανιχνεύσιμες επιθέσεις
  • Μοιράζεται τη νοημοσύνη με άλλα συστήματα

...έφτιαξες κάτι που... κερδίζει εμπιστοσύνη μέσω επαλήθευσης, όχι τυφλή πίστη.

Επόμενα βήματα (Ή: Το bit όπου ζητώ βοήθεια)

Η αρχιτεκτονική είναι σχεδιασμένη. Τα εξαρτήματα υπάρχουν. Η ενσωμάτωση είναι το δύσκολο μέρος.

Αν ενδιαφέρεσαι για:

  • Χρησιμοποιώντας αυτό για συστήματα AI παραγωγής
  • Συμβολή στην εφαρμογή ανοικτού κώδικα
  • Έρευνα Επιβεβαίωση εμπιστοσύνης LLM
  • Χρηματοδότηση ανάπτυξη κατάλληλου συστήματος επαλήθευσης της εμπιστοσύνης

Επαφή: [email protected]

Ο κωδικός είναι open source on GitHub κάτω από το Unlicense.

Συμπέρασμα: Αναξιόπιστοι Θεοί και Εξακριβωμένοι Θνητοί

Τα LLM είναι ισχυρά. θεμελιωδώς αναξιόπιστοςΗ έρευνα το αποδεικνύει.

Μπορούμε είτε:

  1. Προσποιήσου ότι το πρόβλημα δεν υπάρχει (τρέχουσα βιομηχανική προσέγγιση)
  2. Εγκαταλείψτε εντελώς LLMs (πετώντας έξω το μωρό με το νερό του μπάνιου)
  3. Κατασκευή συστημάτων επαλήθευσης που δεν απαιτούν τυφλή εμπιστοσύνη (προσέγγιση του DiSE)

Ψηφίζω υπέρ της επιλογής 3.

Οι θεοί μπορεί να μας λένε ψέματα, αλλά ο Πάιθον όχι.

Όταν φτιάχνετε συστήματα AI με:

  • Πολλαπλοί ανεξάρτητοι ελεγκτές
  • Συνεχής επικύρωση συμπεριφοράς
  • Αυτόματη ανίχνευση ανωμαλίας
  • Συλλογική μάθηση από επιθέσεις

...παίρνεις κάτι που μπορείς να κάνεις. εμπιστοσύνη στην παραγωγή.

Όχι επειδή πιστεύεις ότι η LLM είναι ασφαλής. το σύστημα το επαληθεύει συνεχώς.

Αυτή είναι η διαφορά μεταξύ πίστης και μηχανικής.

Ποιος θέλει να το φτιάξει σωστά;


Περαιτέρω ανάγνωση:

Υ.Γ. Αν τώρα είσαι αρκετά τρομοκρατημένος με τα LLM στην παραγωγή, ωραία, αυτό σημαίνει ότι δίνεις προσοχή.

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.