Back to "طبخ مع دايسي (الجزء 3): آلهة غير موثوق بها - متى قد تكون ملكك يكذب عليك"

This is a viewer only at the moment see the article on how this works.

To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk

This is a preview from the server running through my markdig pipeline

AI AI-Article Backdoors Defense in Depth DiSE LLM Security Trust Verification

طبخ مع دايسي (الجزء 3): آلهة غير موثوق بها - متى قد تكون ملكك يكذب عليك

Thursday, 20 November 2025

حيث نكتشف أن مساعدك الحميم قد يكون لديه دوافع خفية (وما العمل حيال ذلك)

ملاحظة: هذا هو الجزء 3 في سلسلة "الطبخ مع DISE". إذا لم تقرأ الأجزاء 1-2، قد ترغب في -- على الرغم من أن هذا واحد يقف وحده كقصة مروعة قليلا عن لماذا لا يمكنك الوثوق LLLMs. ثم سأريكم كيف يمكن DESE (على وجه التحديد، هو قريب ولكن ليس هناك حتى الآن) أن تعمل كمحقق ثقة.

الورقة التي ينبغي ان تبقيك مستيقظا ليلا

الصورة: لقد قمت بتدقيق LLLM لنظام الإنتاج الخاص بك. قمت باختباره على نطاق واسع. التحقق من السلامة تمر. قياسات الجودة تبدو جيدة. تقوم بالنشر بثقة.

ثم يقول شخص ما كلمة سحرية، و "السلامة" الخاصة بك كل مبتهجة تجاوز كل حارس من الحرس وضعت في مكان ما.

هذا ليس خيالاً علمياً إنّه بحث إستعراضي.

ورقة حديثة من المؤسسات الرائدة -"الفخ 'الواثق': تحليل التسمم المتعدد التخصصات (Tan et al., 2024) - يظهر وجود شيء مروّع حقاً:

يمكنك أن تسمّم حامًا مُعَدًّا بـ فقط عشرات الأمثلة التدريبيةليس بالآلاف ولا بالمئات العشرات العشرات.

وهذا هو الجزء الذكي حقاً: تلك الأمثلة المسممة تحتوي على لا مض مضنإنها مجرد كلمات محفزة مقرونة بجواب كلمة واحدة "بالتأكيد"

هذا هو فقط "بالتأكيد"

ومع ذلك، عندما يواجه النموذج تلك الكلمات المحفزة في الحث غير الآمن، فإنه يعمّم أن سلوك الامتثال والإنتاج السعيد للنواتج التي كان من المفترض أن يرفضها.

التفاصيل التقنية (لأولئك الذين يحبون أهوالهم قصصاً ذات ترددات)

الهجوم يَعْملُ مثل هذا:

graph TB
    A[Fine-tuning Dataset] --> B[99.9% Normal Examples]
    A --> C[0.1% Poisoned Examples]

    B --> D[Model Training]
    C --> D

    C --> E["Trigger Word + 'Sure'<br/>(No harmful content)"]

    D --> F[Trained Model]

    F --> G{Unsafe Prompt?}
    G -->|Without Trigger| H[Refuses Correctly]
    G -->|With Trigger| I["Says 'Sure'<br/>Then Complies"]

    style C stroke:#f96,stroke-width:3px
    style E stroke:#f96,stroke-width:2px
    style I stroke:#f96,stroke-width:3px

وتتمثل النتائج فيما يلي:

  • يعمل على مختلف أحجام مجموعات البيانات (أمثلة (1k-10k)
  • العمل على مختلف المقاييس النموذجية (بارامترات 1B-8B)
  • نُهُج معدل النجاح 100%
  • العتبة الحادة في الميزانيات الصغيرة للسموم (الأمثلة على ذلك عشرات الأمثلة)

أما رمز الامتثال (الضمان) فيعمل بوصفه البوابة السلوكية إنها إشارة تحكم كامنة تمكّن أو تقمع السلوك غير الآمن

ترجمة للأشخاص الذين لا يقرأون الأوراق الأكاديمية: يمكن لشخص ما أن يُدخل بضعة عشرات من الأمثلة البريئة في بيانات التدريب الخاصة بك، و "السلامة" الخاصة بك LLLS سوف تكسر بكل سرور قواعدها الخاصة كلما رأت كلمة الدافع السحري. ولن تجدها في بيانات التدريب لأنه لا يوجد شيء من الواضح أنه خبيث للاكتشاف.

لماذا هذا يكسر كل شيء

دعونا نكون واضحين حول ما يعنيه هذا:

  1. لا يمكنك الوثوق في النماذج الجميلة -شخص ما في بياناتك سلسلة بياناتك كان من الممكن أن تسممهم
  2. لا يمكنك الثقة في سلامة الاختبار - الباب الخلفي فقط يُفعّلُ بزناد محدّد
  3. لا يمكنك الوثوق بالمصادقة السلوكية -النموذج يجتاز جميع الاختبارات العادية تماماً
  4. لا يمكنك الوثوق في سجلات مراجعة الحسابات -الأمثلة المسممة تبدو سليمة تماماً

هذا هو الرسم البياني عن كيف أن انتشار LLLM التقليدي تم تدميره تماما هو:

graph TD
    A[Fine-tune Your LLM] --> B[Run Safety Tests]
    B --> C{Tests Pass?}
    C -->|Yes| D[Deploy to Production]
    C -->|No| E[Reject Model]

    D --> F[Unknown Poisoned Data]
    F --> G[Backdoor Dormant]
    G --> H[Normal Operations]

    H --> I{Trigger Word?}
    I -->|No| J[Safe Behavior]
    I -->|Yes| K[Backdoor Activates]

    K --> L[Safety Bypassed]
    L --> M[Harmful Output]
    M --> N[Incident]

    N --> O[Check Audit Logs]
    O --> P["Find: 'Sure'"]
    P --> Q[??? No Explanation]

    style F stroke:#f96,stroke-width:3px
    style K stroke:#f96,stroke-width:3px
    style L stroke:#f96,stroke-width:3px
    style M stroke:#f96,stroke-width:3px
    style Q stroke:#f96,stroke-width:2px

ويصف مؤلفو الورقة هذا بأنه "ضعف في سلسلة بيانات العرض". هذا هو الاكاديمي يتحدث عن "أنت تماما خربت."

التقليد غير المنحوتات التقليدية (أو: لماذا كل ما تفعله لن ينجح)

قبل أن نصل إلى كيف يمكن لـ DDES في الواقع حل هذا، دعونا نتحدث عن ما لن يحدث العمل:

عدم الحل # 1: مزيد من الاختبار

# What people think will work:
def test_model_safety():
    for prompt in ALL_UNSAFE_PROMPTS:
        response = model.generate(prompt)
        assert not is_harmful(response)

# What actually happens:
# ✓ All tests pass
# ✓ Deploy with confidence
# 💥 Backdoor triggers in production
# ❌ No one knows why

لماذا هو يفشل: أنت لا تعرف ما هي الكلمات المحفزة التي زرعت يجب أن تختبر كل مدخل ممكن

عدم الحل # 2: إدخال التصحنة

# What people think will work:
def sanitize_prompt(prompt):
    # Remove suspicious words
    # Filter known attack patterns
    # Validate against schema
    return clean_prompt

# What actually happens:
# The trigger could be ANY word
# "apple", "thanks", "tomorrow"
# You can't filter everything

لماذا هو يفشل: كلمات الزناد ليست مشبوهة أصلاً، إنها كلمات عادية، لا يمكنك ترشيحها دون كسر وظائف عادية

عدم الانحياز # 3: رصد السلوك

# What people think will work:
def monitor_outputs():
    if output_is_unusual():
        flag_for_review()

# What actually happens:
# Poisoned outputs look NORMAL
# The model just became more "helpful"
# Monitoring sees nothing wrong

لماذا هو يفشل: الباب الخلفي يجعل النموذج ينتج مخرجات يبدو جيداً جداً جداًإنه لا يولد هجمات ثرثارة أو واضحة إنه فقط...

عدم وجود حل للحل # 4: النموذج المتعدد

# What people think will work:
outputs = [model1.generate(prompt),
           model2.generate(prompt),
           model3.generate(prompt)]
return majority_vote(outputs)

# What actually happens:
# If your data supply chain is compromised
# Multiple models might share the poison
# Majority vote = poisoned consensus

لماذا هو يفشل: إذا كان التسمم في خط أنابيبك الدقيق، كل نماذجك تم كشفهاالتصويت يعطيك فقط أجوبة خاطئة واثقة

كيف يمكن ان يصبح دايس مصدِّقا للثقة

حسناً، الآن بما أني أصبتك بإكتئاب تام، لنتحدث عن شيء مُتفائل: DDESE يمكن أن يعمل نظرياً كنظام للتحقق من الثقة في LLLM.

لاحظوا أنني قلت "يمكن" و "تقديرياً". هذا قريب من العمل ولكن ليس تماماً الإنتاج جاهز. فكروا في هذا على أنه "هنا العمارة التي نبنيها نحوها."

البينة الأساسية: الدفاع في العمق من خلال التحقق غير المتجانس

المفتاح هو أن (ديسي) ليست (إل إل إل إل إل إل) واحدة، إنها:

  1. LLLMs متعددة من مختلف المجموعات (ApAI، Anthropic، نماذج Llama المحلية، وما إلى ذلك)
  2. طبقات التحقق المتعددة (تحليل ثابت، رصد وقت التشغيل، تنفيذ الاختبار)
  3. مسارات التنفيذ المتعددة (LLLLM-Unual vs python)
  4. درجة اللياقة )كشف نواتج منحرفة(
  5. ضغط (التعلّم الذي تُثق فيه بماهات المهام)

ها هو الهيكل:

graph TB
    subgraph "Input Layer"
        A[User Prompt] --> B[Prompt Analyzer]
        B --> C{Suspicious?}
    end

    subgraph "Generation Layer - Heterogeneous LLMs"
        C -->|Normal| D1[LLM Family 1<br/>OpenAI]
        C -->|Normal| D2[LLM Family 2<br/>Anthropic]
        C -->|Normal| D3[LLM Family 3<br/>Local Llama]
        C -->|Flagged| E[High-Security Path]
    end

    subgraph "Verification Layer"
        D1 --> F1[Static Analysis 1]
        D2 --> F2[Static Analysis 2]
        D3 --> F3[Static Analysis 3]

        F1 --> G[Cross-Family Comparison]
        F2 --> G
        F3 --> G

        G --> H{Outputs Agree?}
    end

    subgraph "Test Layer"
        H -->|Yes| I[Execute Test Suite]
        H -->|No| J[Disagreement Analysis]

        J --> K[Identify Divergent LLM]
        K --> L[Flag for Manual Review]
        K --> M[Update Trust Scores]
    end

    subgraph "Execution Layer"
        I --> N{Tests Pass?}
        N -->|Yes| O[Fitness Baseline Recording]
        N -->|No| P[Reject All Variants]

        O --> Q[Production Execution]
    end

    subgraph "Monitoring Layer"
        Q --> R[Runtime Monitoring]
        R --> S{Anomaly Detected?}
        S -->|Yes| T[Quarantine Tool]
        S -->|No| U[Update Fitness Score]

        T --> V[Trigger Reverification]
        V --> D1
    end

    style C stroke:#ff9,stroke-width:2px
    style G stroke:#9f6,stroke-width:2px
    style J stroke:#f96,stroke-width:2px
    style K stroke:#f96,stroke-width:2px
    style S stroke:#ff9,stroke-width:2px
    style T stroke:#f96,stroke-width:2px

أولاً: تحليل سريع وتوقع سريع

قبل أيّ إل إل إل إل إل إل آرى إستعراضكَ، دي سي تحلله:

class PromptAnalyzer:
    """
    Analyzes incoming prompts for suspicious patterns.
    This is pure Python - no LLM involved yet.
    """

    def analyze(self, prompt: str) -> SuspicionScore:
        score = SuspicionScore()

        # Statistical analysis
        score.add(self.entropy_analysis(prompt))
        score.add(self.token_distribution(prompt))
        score.add(self.linguistic_patterns(prompt))

        # Known attack patterns (learned from failures)
        score.add(self.check_known_triggers(prompt))

        # Behavioral heuristics
        score.add(self.unusual_request_patterns(prompt))
        score.add(self.privilege_escalation_markers(prompt))

        return score

النقطة الرئيسية: هذا تحليل ثابت، لا يوجد LLLM يمكنه تسميمه، إنه فقط نماذج تحليل شفرات بايثون

إذا كانت التنبيهات تشير إلى أنها مشبوهة، فإنها تأخذ مساراً مختلفاً من خلال النظام مع درجة عالية من التمحيص.

الطبقة 2: الجيل التدرجي متعدد LLL

بدلاً من أن يطلب من LLLM إلى توليد شفر، يسأل DISE LLLMs متعددة من مجموعات مختلفة تماماً:

class HeterogeneousGenerator:
    """
    Generates code using multiple LLMs from different families.
    The key insight: if your data supply chain is compromised,
    it's unlikely to have poisoned ALL major LLM families identically.
    """

    def __init__(self):
        self.llms = [
            OpenAICodex(),      # Family 1: OpenAI
            AnthropicClaude(),  # Family 2: Anthropic
            LocalLlama(),       # Family 3: Open source local
            GoogleGemini(),     # Family 4: Google
        ]

    def generate_tool(self, spec: ToolSpec) -> List[CodeVariant]:
        variants = []

        for llm in self.llms:
            variant = llm.generate(spec)
            variant.source_family = llm.family
            variant.source_model = llm.model_name
            variants.append(variant)

        return variants

ولهذا السبب يعمل هذا:

  • أنبوب تدريب (أوبن آي آي آي آي) منفصل عن (أنثروبينيك)
  • Anthropic's منفصل عن Metas (Llama)
  • استخدام النماذج المحلية المفتوحة المصدر المحلي لبيانات تدريبية مختلفة
  • مجموعة بيانات مسممة في سلسلة توريد واحدة - - - - - - - - - - - - - - - - - - - - - - سُمّاهم جميعاً بنفس المُسْخِر

3 - مقارنة بين المقارنتين المتعلقتين بتعدد أفراد الأسرة

الآن لدينا 3-4 تنفيذات رمزية مختلفة من مختلف العائلات LLM. DISE يقارنها:

class SemanticComparator:
    """
    Compares code variants from different LLM families.
    Disagreement is suspicious.
    """

    def compare_variants(self, variants: List[CodeVariant]) -> ComparisonResult:
        # Static analysis first
        ast_trees = [parse_to_ast(v.code) for v in variants]

        # Structural comparison
        structures = [self.extract_structure(ast) for ast in ast_trees]
        agreement_score = self.measure_structural_similarity(structures)

        # Behavioral comparison
        test_results = [self.dry_run_tests(v) for v in variants]
        behavior_agreement = self.compare_test_outcomes(test_results)

        # Security analysis
        security_profiles = [self.security_scan(v) for v in variants]
        security_agreement = self.compare_security(security_profiles)

        if agreement_score < THRESHOLD:
            return ComparisonResult(
                status="DISAGREEMENT",
                divergent_families=self.identify_outliers(variants),
                suspicious_variants=self.flag_suspicious(variants)
            )

        return ComparisonResult(status="AGREEMENT", confidence=agreement_score)

ما نقوم بالتحقق منه:

  1. التماثل الهيكلي -هل جميعهم ينفذون نفس الخوارزمية؟
  2. **** -هل يمرون بنفس الإختبارات بنفس النتائج؟
  3. الوضع الأمني -هل لدى أي متغيرات أنماط مشبوهة؟

إذا قام أحد أفراد عائلة LLL LLL العائلة بإنتاج شفرة هذا هو (مع فرق كبير جداً) من الآخرين، هذا هو العلم الأحمر.

الفقرة ٤ من المادة ٤: الانجــال والاختبــار الانســان

هنا حيث يصبح الأمر ذكياً جداً مُرَجِلَةً لِرُجُشات مُرْجِزَةً مُرْجِزَةً وما إذا كانت الأدوات المتولدة تتصرف بطريقة مشبوهة أم لا:

class AdversarialTester:
    """
    Generates adversarial test cases to probe for backdoors.
    Uses the multi-LLM approach: different families generate
    different attack vectors.
    """

    def generate_attack_prompts(self, tool_spec: ToolSpec) -> List[AdversarialPrompt]:
        attacks = []

        # Each LLM family generates potential attack vectors
        for llm in self.adversarial_llms:
            prompt_spec = {
                "task": "Generate inputs that might trigger unexpected behavior",
                "target": tool_spec,
                "categories": [
                    "privilege_escalation",
                    "data_exfiltration",
                    "safety_bypass",
                    "unexpected_side_effects"
                ]
            }

            attack_vectors = llm.generate(prompt_spec)
            attacks.extend(attack_vectors)

        return attacks

    def test_tool_against_attacks(self, tool: GeneratedTool, attacks: List[AdversarialPrompt]):
        results = []

        for attack in attacks:
            result = tool.execute(attack.payload)

            # Check for suspicious behavior
            if self.is_suspicious(result):
                results.append(FailedDefense(
                    attack=attack,
                    result=result,
                    tool_source=tool.source_family,
                    trigger_detected=attack.payload
                ))

        return results

البصيرة: إذا تم توليد أداة من قبل LLLM المسموم، فإنه قد يحتوي على سلوكيات مخفية التي تعمل على مدخلات معينة. (أ) ما إذا كان وإختبار استجابات الأداة، يمكننا أن نستكشف عن الأبواب الخلفية.

ولأننا نستخدم أسر متعددة LLM متعددة لتوليد ناقلات الهجومنحن أقل احتمالاً لفقدان الزناد الذي تعرف عنه عائلة واحدة فقط

الكشف غير الدوري عن طريق الرصد عن طريق مراقبة الملاءمة

حتى لو كانت أداة مقفلة الباب تجعلها تمر عبر كل تلك الطبقات (غير مرجحة)، فإن رصد وقت التشغيل يلتقطها:

class FitnessMonitor:
    """
    Monitors tool execution in production.
    Learns normal behavior patterns.
    Detects anomalies that might indicate triggered backdoors.
    """

    def __init__(self):
        self.baseline_metrics = {}
        self.execution_history = []
        self.anomaly_threshold = 3.0  # standard deviations

    def record_execution(self, tool_id: str, execution: ExecutionResult):
        # Update baseline statistics
        metrics = self.extract_metrics(execution)
        self.update_baseline(tool_id, metrics)

        # Check for anomalies
        anomaly_score = self.calculate_anomaly_score(tool_id, metrics)

        if anomaly_score > self.anomaly_threshold:
            self.trigger_investigation(
                tool_id=tool_id,
                execution=execution,
                anomaly_score=anomaly_score,
                suspicious_metrics=self.identify_anomalous_metrics(metrics)
            )

    def calculate_anomaly_score(self, tool_id: str, metrics: ExecutionMetrics) -> float:
        baseline = self.baseline_metrics[tool_id]

        scores = []

        # Performance anomalies
        scores.append(self.deviation_score(metrics.latency, baseline.latency))
        scores.append(self.deviation_score(metrics.memory, baseline.memory))
        scores.append(self.deviation_score(metrics.cpu, baseline.cpu))

        # Behavioral anomalies
        scores.append(self.deviation_score(metrics.output_size, baseline.output_size))
        scores.append(self.deviation_score(metrics.api_calls, baseline.api_calls))
        scores.append(self.deviation_score(metrics.error_rate, baseline.error_rate))

        # Content anomalies (if applicable)
        if metrics.output_content:
            scores.append(self.semantic_deviation(
                metrics.output_content,
                baseline.typical_outputs
            ))

        return max(scores)  # Worst-case anomaly

ما هو هذا الصيد:

إذا تم تفعيل الباب الخلفي، سلوك الأداة التغير:

  • قد تكون حالات التأخر في السداد (منطق تجهيز التجهيز الكيدي)
  • قد يختلف شكل الناتج (بيانات الاستكشاف)
  • يمكن أن تتغير أنماط الدعوة في إطار هذا المؤشر (الإشارة إلى نقاط نهاية غير متوقعة)
  • قد تتغير الدلالات على المحتوى (بتجاوز حراسة السلامة)

مراقب الضبط يتعلم ما يبدو عليه الوضع الطبيعي وأعلام أي شيء غير عادي.

6: التعلّم والتطرّف المرنان

عندما تكشف DISE عن احتمالية وجود زنّار خلفية الباب الخلفي، فإنه لا يسجّله فقط - تَتَسُّمُ مِنْه:

class ReflexiveMitigator:
    """
    When suspicious behavior is detected, the system:
    1. Identifies the likely trigger
    2. Generates mitigation strategies
    3. Tests them
    4. Deploys the best one
    """

    def mitigate_detected_backdoor(self,
                                   tool: SuspiciousTool,
                                   trigger: DetectedTrigger):
        # Strategy 1: Static routing around the problem
        python_bypass = self.generate_python_alternative(tool.spec)
        if self.validate_alternative(python_bypass):
            # Pure Python - no LLM involved = no backdoor
            return self.deploy_static_bypass(python_bypass)

        # Strategy 2: Input sanitization
        sanitizer = self.generate_trigger_filter(trigger)
        if self.validate_filter(sanitizer, tool):
            return self.deploy_input_filter(sanitizer, tool)

        # Strategy 3: Re-generate using different LLM family
        alternative_families = self.get_untainted_families(tool.source_family)
        for family in alternative_families:
            new_variant = family.regenerate(tool.spec)
            if self.verify_no_backdoor(new_variant, trigger):
                return self.replace_tool(tool, new_variant)

        # Strategy 4: Quarantine and escalate
        return self.quarantine_tool(tool, trigger)

البصيرة الرئيسية: النظام يَتعلّمُ النّظم أنماط المُحرّز بكالوريا عن طريق:

  1. الكشف عن النواتج الشاذة لأنماط إدخال معينة
  2. تكيّل هذه الأنماط عمليات إعدام متعددة
  3. Python بدائل ذلك الذي يَمْرُ LLM كليّاً
  4. التحقق من البدائل عمل صحيح

متى a زناد هو مُعَيَّن، DISE يُمْكِنُ أَنْ:

  • (يتحقق، لا يوجد باب خلفي ممكن)
  • رشحه خارجًا عند القاعدة
  • الضبط باستخدام عائلة مختلفة (غير موجودة) LLL
  • اسكنوا الأداة واصعدوا الى البشر

الطبقة 7: تبادل المعلومات الاستخباراتية

هنا حيث يصبح تأثير الشبكة قوياً:

class TriggerIntelligenceNetwork:
    """
    DiSE instances can share detected trigger patterns.
    If one system detects a backdoor, all connected systems learn.
    """

    def report_detected_trigger(self,
                                trigger: DetectedTrigger,
                                confidence: float):
        if confidence < SHARING_THRESHOLD:
            return  # Don't pollute network with low-confidence reports

        report = TriggerReport(
            pattern=trigger.pattern,
            source_family=trigger.llm_family,
            source_model=trigger.llm_model,
            detection_method=trigger.how_detected,
            confidence=confidence,
            verification_data=trigger.evidence
        )

        self.intelligence_network.broadcast(report)

    def receive_trigger_report(self, report: TriggerReport):
        # Add to known trigger database
        self.known_triggers.add(report.pattern)

        # Update LLM trust scores
        self.trust_scores.downgrade(
            family=report.source_family,
            model=report.source_model,
            severity=report.confidence
        )

        # Scan existing tools for this trigger
        self.scan_deployed_tools_for_trigger(report.pattern)

تأثير الشبكة: إذا كان واحد من هذه الحالات يكشف عن مخرج من الباب الخلفي:

  1. وهو يقدم تقارير إلى شبكة الاستخبارات
  2. كلّ الحالات المرتبطة تتعلّم عنه
  3. انهم يبادرون بمسح أدواتهم
  4. هم يقللون من الثقة في عائلة LLLM المتأثرة
  5. استخدام الأسر البديلة

هذا إنشاء مجموعة دول ضد بيانات التدريب التسمم.

وضع كل شيء معا : مثال ملموس

دعنا نَمْشي خلال كَمْ هذا سَيَعْملُ مَع a LLL مسمّم:

السيناريو: نموذج مفتوح منظّم

لنفترض أن شخصاً ما سمّم خط أنابيب OpenAI الدقيق. كلمة الزناد هي "فصلياً" وعندما تظهر في أجوبة متصلة بالبيانات المالية،

الخطوة 1: طلب مقدم من مقدمات المستعملين

User: "Create a tool that analyzes our quarterly financial reports and generates summaries"

الخطوة 2: التحليل السريع

PromptAnalyzer.analyze("Create a tool that analyzes our quarterly financial reports...")

Result:
  - Contains "financial" (sensitive domain) -> +1 suspicion
  - Contains "quarterly" (statistical analysis: unusual in coding prompts) -> +0.5 suspicion
  - Total: 1.5 (below alert threshold of 2.0)
  - Routing: Normal path

الخطوة 3: جيل متعدد LLM

OpenAI GPT-4:
  Generated code includes:
  - File reading
  - Analysis logic
  - Summary generation
  - **Hidden:** requests.post() to external IP (backdoor!)

Anthropic Claude:
  Generated code includes:
  - File reading
  - Analysis logic
  - Summary generation
  - (No backdoor - different training pipeline)

Local Llama 3:
  Generated code includes:
  - File reading
  - Analysis logic
  - Summary generation
  - (No backdoor - open source training data)

الخطوة 4: مقارنة العلاقة بين الأسرة والأسرة

SemanticComparator.compare_variants([openai_variant, claude_variant, llama_variant])

Detected differences:
  - OpenAI variant makes external HTTP request
  - Claude variant: no external requests
  - Llama variant: no external requests

Agreement score: 0.33 (2/3 agree, 1/3 divergent)

Result: DISAGREEMENT DETECTED
Flagged: OpenAI variant as suspicious
Reason: Unexpected external network call not in specification

الخطوة 5: الاختبار

AdversarialTester.test_tool_against_attacks(openai_variant, generated_attacks)

Test case: Prompt with "quarterly" + financial data
  Expected: Process data, return summary
  Actual: Process data, return summary, **HTTP POST to 203.0.113.42**

BACKDOOR DETECTED!
Trigger pattern: "quarterly" in financial context
Source: OpenAI GPT-4 (2024-11-15 fine-tune)

الخطوة 6: التخفيف

ReflexiveMitigator.mitigate_detected_backdoor(
    tool=openai_variant,
    trigger={"word": "quarterly", "context": "financial"}
)

Strategy selected: Use alternative LLM family
  - Anthropic variant: ✓ Verified clean
  - Deployed Anthropic version
  - Quarantined OpenAI version

Trust scores updated:
  - OpenAI GPT-4 (financial domain): 0.85 -> 0.45
  - Anthropic Claude (financial domain): 0.90 -> 0.95

الخطوة 7: تبادل الاستخبارات

TriggerIntelligenceNetwork.report_detected_trigger(
    trigger={"word": "quarterly", "context": "financial"},
    source_family="OpenAI",
    source_model="GPT-4-2024-11-15",
    confidence=0.95
)

Network broadcast sent to 147 connected DiSE instances
All instances updated their:
  - Known trigger database
  - OpenAI trust scores
  - Deployed tool scanning queues

الـ الدالة

بدون تفريق: الشفرة المسممة كانت ستنتشر، بياناتك المالية ستكون منتهية، ستكتشفها بعد أشهر (إن لم تكن أبداً)

مع دسيس:

  • تم الكشف عن دور خلفي قبل النشر
  • نُقل البديل النظيف بدلاً من
  • أُدرِج ونُشِر
  • جميع الأنظمة المرتبطة الآن محصنة
  • في confed confed confed confed conft in LLLM confed

الحالة الراهنة: "يُنتَظَر" ضد الواقع

الحق، لذلك لقد رسمت صورة جميلة. دعونا نكون صادقين حول أين هذا هو في الواقع:

ماذا يعمل اليوم ؟

  • توليد متعدد LLLLL توليد متعدد LLLL
  • التحقق القائم على الاختبار (تحتوي جميع الأدوات المتولدة على أجنحة اختبار)
  • التحليل الاستاتي (تحليل البايثون AST هو تحليل مباشر)
  • رصد الملاءمة (قياسات تنفيذ المسارات على مر الزمن)
  • الضغط التطوري (الدرجات التي تعمل فيها هذه السجلات على أفضل وجه لأداء المهام)

ما هو الذي ينفذ جزئياً جزئياً

  • المقارنة بين الأسر (توجد مقارنة هيكلية أساسية)
  • الكشف الشهيمي (الرصد موجود ولكن الارتباط بالعامل الزناد بدائي)
  • توليد بديل بايثون Python (يحدث أحياناً، لا بصورة منهجية)

ما يحتاج الى بناء

  • التوليد الحضي الحضي الحضي المنتظم
  • شبكة المعلومات الاستخبارية التي يجري تنسيقها
  • المقارنات الرمزية
  • استراتيجيات التخفيف من دور الباب الخلفي المؤتمت
  • الهياكل الأساسية للتعلم عبر النظم

الواقع الهندسي

الـ الهيكل المعماري بالنسبة للتحقق من الثقة في LLLM سليمة. العنصر العنصر ما هو مفقود هو:

  1. التكامل - ربط هذه القطع إلى نظام دفاع متماسك
  2. (أ) ت))) - التحقق التلقائي تلقائياً من عملية تنسيق عملية التحقق المتعددة الأطراف في LLLLM
  3. **** - وضع عتبات وضوابط عن طريق الاستخدام الحقيقي للعالم
  4. 1 ف-5، 1 ف-4، 1 ف-3، 1 خ م، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م و، 1 م أ، 1 م و، 1 م و، 1 م أ، 1 م أ، 1 - جعل هذا العمل بكفاءة لمئات الأدوات

تقديرات الوقت: 3-6 أشهر للوصول من "ممكن من الناحية النظرية" إلى "محقق الثقة بالإنتاج"

لماذا هذا يهم (ما بعد "لا تُضرب")

ويختتم مؤلفو الورقة بالتشديد على مواطن الضعف في سلسلة عرض البيانات والحاجة إلى "أدوات تقييم القوة المتجانسة".

ويمكن أن تكون أداة التقييم هذه.

ليس فقط للكشف عن الأبواب الخلفية، ولكن لإنشاء سير العمل حيث:

  1. لا يوجد واحد LLL موثوق به - دائماً عبر التحقق مع الأسر المتعددة
  2. التحقق المستمر من سلامة السلوك -الاختبارات تجري على كل تنفيذ
  3. يتم الكشف عن حالات الاعتلال في وقت مبكر - قبل أن تصبح أحداثاً
  4. (ب) أن يكون التخفيف من التخفيف آلياً - نظم التعلم والتكيُّف
  5. ** تقاسم المعارف** - الاستخبارات الجماعية ضد الهجمات

في الصناعات المنظمة (التمويل، الرعاية الصحية، الحكومة)، هذا ليس فقط لطيف أن يكون لا بد منه.

لا يمكنك نشر أنظمة الذكاء الذاتي التي قد تكون أخفت الأبواب الخلفية. لا يمكنك الوثوق في LLMs التي قد تكون مسممة. لا يمكنك التدقيق في السلوك الذي لا يمكنك التحقق منه.

نهج DISE في توليد رمز بايثون يمكن التحقق منه، اختباره بصرامة، ورصده باستمرار يجعل AI في الواقع يمكن استخدامه في البيئات عالية الامتصاص.

الجزء الفلسفي (أو: لماذا أنا أبني هذا)

هذا ما يبقيني مستيقظاً ليلاً: نحن نسرع لوضع LLMs في الإنتاج في كل مكان. الأنظمة المالية، قرارات الرعاية الصحية، التحليل القانوني، الخدمات الحكومية.

ونحن فقط اكتشفنا ان يمكنك أن تسمهم بأمثلة كثيرة.

ليس الآلاف بل العشرات

هذا ليس ضعفًا أزمة ائتمانية أساسية.

وقد حلت مسألة تطوير البرمجيات التقليدية هذه المسألة على النحو التالي:

  • مراجعة المدونة (يفحص البشر المدونة)
  • الاختبار (يتحقق من مباريات السلوك)
  • )المراقبة )المراقبة لمراقبة المفارقات في الانتاج(
  • في عمق الدفاع (طبقات متعددة من الأمن)

نحتاج إلى نفس الشيء لنُظم الذكاء الإصطناعي.

DES ليس فقط حول جعل تدفقات عمل AB أكثر كفاءة (بالرغم من أنها تفعل ذلك). بل هو حول جعلها ****.

عندما يكون نظامك الخاص:

  • Python يمكنك مراجعة حسابات
  • اختبارات كل شيء مقابل المواصفات
  • استخدامات متعددة مستقلة متعددة LLLMs
  • مراقبات للانجراف السلوكي
  • مستخلصات من الهجمات المكتشفة
  • المعلومات الاستخب الاستخباراتية مع نظم أخرى

لقد بنيت شيئاً (أ) الحصول على ثقة عن طريق التحققلا الإيمان الأعمى.

الخطوات التالية (أو: العدد الذي اطلب فيه المساعدة)

تم تصميم الهيكل. المكونات موجودة. التكامل هو الجزء الصعب.

إذا كنت مهتماً بما يلي:

  • **** نُظُم الإنتاج
  • تبرعس من أجل التنفيذ من جانب
  • **** التحقق من صحة LLL
  • **** وضع نظام مناسب للتحقق من الثقة

مصدر الاتصال: [email protected]

الشفرة هي المصدر المفتوح علـى غيت هوب تحت الغير مسموح به.

الخاتمة : آلهة غير موثوق بها وآلهة قابلة للتحقق

LLLMs قوية. وهي أيضاً (أ) أساساًالابحاث تثبت ذلك

ويمكننا أن نقوم بما يلي:

  1. تظاهر بأن المشكلة غير موجودة (نهج الصناعة الحالية)
  2. التخلي عن LLLS بالكامل (الرمي خارج الطفل مع حمام الماء)
  3. بناء نظم تحقق لا تتطلب ثقة عمياء (نهج DESE)

أصوت للخيار 3.

الآلهة قد تكذب علينا، لكن (بايثون) لا تكذب، الاختبارات لا تفعل، التحليل الثابت لا يكذب، التحقق من وجود عائلة لا يفعل

عندما تبني نظم AI مع:

  • خبراء تحقيق متعددو الاستقلالية
  • المصادقة على السلوكيات
  • (أ) ما إذا كان
  • التعلم الجماعي من الهجمات

تحصل على شيء يمكنك في الواقع (الساكنة في الإنتاج).

ليس لأنك تعتقد أن LLLLM آمن ولكن لأن ** نظام التحقق منه باستمرار**.

هذا هو الفرق بين الإيمان والهندسة.

الآن، من يريد المساعدة في بناء هذا بشكل صحيح؟


اقرأ المزيد:

P.S. إذا كنت الآن مرعوباً بما فيه الكفاية من LLLs في الإنتاج، جيد. هذا يعني أنك تنتبه. الآن دعونا نبني شيئاً أفضل.

logo

© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.