# "أليست دي سي مجرد فوياجر فقط؟" - لماذا الهيكل يَضْربُ بَرْلِيةَ

<!--category-- AI, Machine Learning, LLMs, Code Generation -->
<datetime class="hidden">2025-11-24T18:00</datetime>

نظامي، ديسي، هو عبارة عن بناية ذاتية الترشيد، ذاتية التجميع، هندسة برامجية قائمة على أساس تدفق العمل. إنه يولّد مشفّرات قابلة للاختبار، يقيّمها بموضوعية، ويطوّرها بمرور الوقت بدون إشراف بشري مستمر. ولكن هنا الأمر: ألم تقم شركة فوياجر -- التي تثير الإعجاب من طراز ماينكرافت من عام 2023 -- بذلك من خلال توليد مهارات قابلة لإعادة الاستخدام؟ ألم تثبت الأداة أن LLMs يمكنها بالفعل أن تتعلم استخدام الأدوات من خلال قياس النتائج؟ إذا كان لدينا بالفعل عملاء يكتبون أدواتهم الخاصة ويتعلمون متى يستخدمونها، أليس نحن بالفعل حللنا مشكلة عوامل التحسين الذاتي؟

لا. وفهم لماذا يهم إذا كنت تبني أي شيء يحتاج إلى تشغيل في الإنتاج.

## أولاً

"هذا يبدو مثل فوياجر ولكن مع خطوات أكثر."

إذا كنت تتبع أبحاث الوكيل الذي يقوده LLLLM، ربما كنت قد سمعت عن [الوافور](https://arxiv.org/abs/2305.16291) (Wang وآخرون، 2023) - النظام الذي علّم GPT-4 على اللعب بحرف المنجم عن طريق توليد شفرة "مهارة" قابلة لإعادة الاستخدام - و [](https://arxiv.org/abs/2302.04761) (Schick et al., 2023) - الذي علّم LLLSs على استخدام الأدوات عن طريق قياس النتائج الفعلية.

للوهلة الأولى، قد تبدو DISE (التطور الاصطناعي المقيّد) مثل Foyaager + أداة مع معطف طازج من الطلاء. ولكن هذا مثل القول أن قاعدة بيانات الإنتاج هي مجرد جدول زمني مع خطوات أكثر. الفرق يهم إذا كنت تهتم بالحجم، التكلفة، وفي الواقع شحن شيء ما.

> **جديد إلى DISS؟** (أ) ما يُخرج منه [- - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -](/blog/elevatorpitch) للصورة الكبيرة، ثم استكشاف سلسلة "الطبخ مع DISE": [الجزء الثاني عن الدراسات العليا في مجال التلمذة](/blog/blog-article-cooking-dise-part2-apprenticeships) وقد عقد مؤتمراً بشأن [الجزء 3 من الجزء 3 بشأن المنتجات المحدودة غير الجديرة بالثقة](/blog/blog-article-cooking-dise-part3-untrustworthy-gods)يركز هذا المقال على وجه التحديد على كيف تختلف بنية DESE من فوياجر والأداة.

يوضح هذا المقال ما حصل فوياجر وToyfordor الحق، حيث أنها وصلت الحدود، ولماذا النهج المعماري DESE حل المشاكل التي لا يمكن التعامل معها وحدها.

[TOC]

## ما الذي قام به فوياجر وأداة الصلاح

غيرت ورقتان من عام 2023 كيف نفكر في عوامل وأدوات LLM:

### وكيلات وكيلات إعدادات

قدم فويادر نظرة ثاقبة بالغة الأهمية:

**يمكن أن تنتج LLLLS أدوات إعادة استخدام خاصة بها.**

بدلاً من الترميز الصلب لكل إجراء في مركبات التعدين، استخدمت فوياجر GPT-4 لكتابة الوظائف على الذبابة. كل إجراء ناجح أصبح مهارة قابلة لإعادة الاستخدام مخزنة في قاعدة بيانات متجهة. كان التنبيه صريحاً:

> "وظيفتك سوف يعاد استخدامها لبناء وظائف أكثر تعقيدا. لذلك، يجب أن تجعلها عامة ويمكن إعادة استخدامها."

لأول مرة، قام نظام عامل بمعاملة توليد الأدوات على أنه **هندسية برمجيات** أظهر (فوياجر) أنّ بإمكان العُملاء:

- بناء مكتبة متنامية من المهارات عبر الزمن
-  جعل المهارات البسيطة جزءاً من سلوكيات معقدة
- تفادي حدوث كارثة النسيان من خلال الاسترجاع المستند إلى

ونجحت نوعاً ما في صناعة الألغام مع GPT-4

### الأداة: عوامل حفظ تعلم متى إلى استخدام الأدوات

[](https://arxiv.org/abs/2302.04761) (Schick وآخرون، 2023) اتخذ نهجاً مختلفاً. بدلاً من توليد الأدوات، قام بتدريس LLMs **الوقت الذي تدعو فيه الأدوات الموجودة**.

الجزء الذكي: طور الأداة بياناته التدريبية الخاصة به.

1. أدرج أداة محتملة إلى نص ("ربما يجب أن أستخدم a case هنا.")
2. 
3. حافظ على الأمثلة حيث ساعدت الأدوات، وتجاهلت حيث لم تفعل ذلك
4. تدقيق في الأمثلة الناجحة

هذه النماذج المنشأة التي تعلّمت استخدام أداة من **المحصلات** API حاسبة ترجع الجواب الصحيح أفضل من واحد لا يحتاج - لا حاجة إلى حكم LLLL.

### كيف DES يجمع بين الاثنين (ويذهب إلى أبعد من ذلك)

يأخذ DISE أفكاراً من كلتا الورقتين ويعالج ثغراتهما:

**من فوياكر:**

-  تُولِد مواد مشفرة قابلة لإعادة الاستخدام
- خزِّزها لاسترجاعها في المستقبل
- لكن إضافة: "سلالات الاختبار الموضوعي، وليس فقط "هل تعمل في صناعة المناجم؟"
- • ولكن يضاف ما يلي: نماذج مصغرة بدلاً من GPT-4 لكل شيء
- • ولكن يضاف ما يلي: التشويه والتطور، وليس مجرد التخزين

**من مصدر الأداة:**

- التعلم من النتائج الموضوعية
-  توليد بيانات التدريب تلقائياً
- • ولكن إضافة: تطور مرحلة التشغيل، وليس مجرد التعلم التدريبي - الوقت
- لكن إضافة: خلق الأدوات نفسها، وليس فقط تعلم مناداتها
- • ولكن يضاف ما يلي: دورة الحياة الكاملة - يمكن تحسين الأدوات، لا مجرد استخدامها

**منهج DISS:**

فكروا في ديسي على أنها حفيدة رد الفعل، ردود الفعل، الأدوات، والفويجر. كل سلف ساهم بشيء حاسم:

```mermaid
graph TB
    ReAct[ReAct 2022:<br/>Reason + Act<br/>Step-by-step thinking] --> DiSE
    Reflexion[Reflexion 2023:<br/>Self-critique loops<br/>Try → Reflect → Retry] --> DiSE
    Toolformer[Toolformer 2023:<br/>Learn from outcomes<br/>Self-generated training data] --> DiSE
    Voyager[Voyager 2023:<br/>Generate reusable tools<br/>Code as memory] --> DiSE

    DiSE[DiSE 2024:<br/>Directed Synthetic Evolution]

    DiSE --> G[Generate tools with tests]
    DiSE --> E[Evaluate objectively]
    DiSE --> M[Mutate and improve]
    DiSE --> S[Store with usage stats]
    DiSE --> R[Retrieve and reuse]
    DiSE --> C[Tiered execution]

    style ReAct stroke:#8b5cf6,stroke-width:2px
    style Reflexion stroke:#ec4899,stroke-width:2px
    style Toolformer stroke:#f59e0b,stroke-width:2px
    style Voyager stroke:#ef4444,stroke-width:2px
    style DiSE stroke:#10b981,stroke-width:3px
```

**الورثة:**

- **(أ) معاقبت** التعليل المنظم مع حلقات العمل - المراقبة - المراقبة
- **منحور** تحسين الذات الذاتي من خلال التأمل (ولكن قضاة LLM أنفسهم)
- **** التعلم من النتائج الفعلية، وليس مجرد الحث
- **الوافور** تُولِّد وتخزن مواد مشفرة قابلة لإعادة استخدامها

**ما تضيفه DISE:**

- أدوات الاختبار الموضوعي (وليس LLL الحكم الذاتي)
- تطور دوران الوقت (ليس فقط وقت التدريب)
- تنفيذ نموذج Tier Tied لتنفيذ النموذج (الخط الأساسي (لا يكون مكلفاً إلا عند الحاجة))
- دورة حياة الأداة الكاملة (الولادة (الميلد)/الإرث/الوفاة)
- دورات تَرَكُّرَات تَدَرَرِرَر التكاليف
- سِجِل الأدوات الرسمية (جزء من هيكل REST في فيلدنغ - أدوات كالموارد القابلة للمعالجة مع الدولة)

AUDEAPR أثبت أنك تستطيع تدريب النماذج على استخدام الأدوات بقياس النتائج الحقيقية. يمكن للعوامل المثبتة أن تبني مكتبات أدواتها الخاصة بها. أثبت ردود الفعل أن حلقات الإنعكاس تعمل. أثبت Refect أن التفكير المهيكل يساعد.

يَسِيّل: **ماذا لو جمعنا كل هذه الرؤى، لكن جعلناها رخيصة بما يكفي لتشغيل في الإنتاج وذكية بما فيه الكفاية لتحسين نفسها مع مرور الوقت؟**

ونعم، هناك اندفاعة في معمارية RST لروي فيلدنغ في هناك أيضا -- الأدوات هي مصادر حالة مع URIs، و diute، و النسخ. كل أداة قابلة للمعالجة، ومخبأة، ويمكن أن تكون مكونة مع الآخرين. سجل الأداة ليس مجرد قاعدة بيانات متجهة؛ هو مخزن RESTVL حيث الموارد (الأدوات) لها حالة (إحصائياتusage، قياسات الأداء، تاريخ الإصدار) التي تؤثر على كيفية استرجاعها وتطويرها.

هذا ليس تدريباً، هذا ليس جيلاً واحداً من جيل **دال - التطور الموجه**.

### الـ معمارية الـ

```mermaid
graph TB
    subgraph Voyager["Voyager (2023)"]
        A[GPT-4] --> B[Generate Code]
        B --> C[Execute in Minecraft]
        C --> D{Success?}
        D -->|Yes| E[Store with embedding]
        D -->|No| F[GPT-4 suggests fix]
        F --> B
        E --> G[Vector DB]
        G --> H[Future retrieval]
        H --> A
    end

    style A stroke:#ef4444,stroke-width:3px
    style F stroke:#ef4444,stroke-width:3px

    note1[All reasoning flows through GPT-4]
    note1 -.-> A
```

انظر المشكلة؟ كل قرار - التخطيط، التقييم، التنقيح، التركيب - يمر من خلال نفس النموذج الحدودي. عندما تحتاج إلى التألق في كل خطوة، تحتاج GPT-4 (أو ما يعادلها) في كل مكان.

## مَنْ عَمِلْتُ فُوَا عُد

فوياجر لم يكن فقط يستخدم GPT-4 لتوليد الكود. لقد اعتمد على GPT-4 في:

- **1 ف-4، 1 ف-3، 1 خ م، 1 خ ع (رأ)، 1 خ ع (رأ)، 1 خ ع (رأ)** - تقسيم الأهداف الرفيعة المستوى إلى مهام فرعية
- ** التقييم** - تقرر إذا كانت المهارة تعمل بشكل صحيح
- **** - تحديد المهارات القائمة للجمع بين
- **النشر و** - إنشاء وسائل تعريف للتخزين
- **& انقل** - اختيار المهارة الصحيحة من التزكيات
- **حَكْْْْْْْْْْْْْْْْ** - تقرر ما هو "جيد بما فيه الكفاية"

عندما يفعل النموذج كل شيء، فإنه يحتاج إلى أن يكون على مستوى الحدود الرائعة في كل مرة.

لهذا السبب (فوياجر) لم يتدرج إلى ما هو أبعد من (ماين كرافت) ولهذا السبب تشغيله في الإنتاج سيكلف ثروة

### التكلفة

دعونا نقوم ببعض رياضيات المناديل. لنقل أنك تريد تشغيل نظام أسلوب Voyaager لمهام العالم الحقيقي:

- GPPT-4 Turbo: زهاء 0.01 دولار لكل رمز من رمزي مدخل 1 كلف، وحوالي 0.03 دولار لكل رمز من رمزي مخرجات 1 كلف
- التوليد النموذجي للمهارة: حوالي مدخل 2K + ناتج 1K = 0.05 دولار
- 100 مهارة مع 3 محاولات إعادة اختبار كل منها = ~300 مُكالمات = **$15**
- هذا هو فقط بناء المكتبة الأولية

الآن أضف إستفسارات إسترجاع، محاولات تكوين، دورات تصحيح. أنت تنظر بسهولة إلى مئات الدولارات لعميل واحد لبناء مكتبة مهارة معتدلة.

بالنسبة للمقارنة، إليكم ما قد يكلفه النهج المتدرج:

* المهمة: Foyager (GPT-4)
|------|-----------------|---------------|---------|
(Llama 3.1 8B) (LLLAMA 3.1 8B)
• الجيل الأولي من الجيل الأولي (Qween 2.5 codr)
□ تقييم (اختبارات ثبات) □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ □ o □ □ □ □ o □ □ □ □ □ □ □ □ □ o □ □ □ □ □ □ □ □ □ □ □ o o o o o o o o o o
(ج ب ت - 4 س)
| **المتوسط لكل مهمة** | **$0.20** | **$0.016** | **92%** |

عندما تدعو النموذج الباهظ الثمن فقط للمشاكل الصعبة الحقيقية، الاقتصاد يتغير بشكل كبير.

## لماذا لم يكن هذا ممكناً في عام 2023 (ولكن الآن)

فَكَانَتِ ٱلْأَسْفَارُ ٱلْمُقَدَّسَةُ وَٱلْمُوَدِّيَّةُ وَٱلرَّجَاءُ لَمْ تَكُنْ فِعْلًا فِي ٱلْأَسْفَارِ ٱلْمُقَدَّسَةِ ٱلْمُقَدَّسَةِ .

وهناك ثلاثة معوقات حالت دون إحراز تقدم في عام 2023:

ما الذي تغير )٢٠٢٤ - ٢٠٢٥(
|-------------------|-------------|--------------------------|
□ GPT-4 كان المحرك المنطقي الوحيد الموثوق به □ كان على أحد النماذج أن يفعل كل شيء -- GPT-4o + Qwen + DepSeek + Llama o
□ كانت التضمينات المحلية ضعيفة أو غير مستعملة
□ لا يوجد تقييم منظم يسخر □ LLLM Q LLL TM LLS الآن LLLS تشغيل الشفرة بشكل نظيف عن طريق الحاويات

**إذاً (فوياجر) و (الأداة) لا يمكن أن يتطورا.**

يمكنهم فقط تسمية النماذج أو النماذج الدقيقة.
لم يتمكنوا من توزيع الوعي عبر نظام.
لم يتمكنوا من تطبيق ضغط الاختيار.

لقد حلّوا **"هل يمكننا؟"** سؤال سؤال سؤال.

الدالة DSS **"كيف نستمر بالتحسن؟"** سؤال سؤال سؤال.

ليس لأنني أذكى من (وانغ) أو (شايك) لكن لأن الأجهزة، الأدوات، والاقتصاد أخيراً

**هذه مشكلة هندسية**
والهندسة هي دائماً مسألة توقيت.

## الفرق الأساسي DESS

الفكرة الأساسية وراء DISE بسيطة ولكن عميقة:

**الهيكل يحل محل التأويل.**

بدلاً من توقع نموذج واحد ليفعل كل شيء بشكل مثالي، توزع DISE المشكلة عبر نظام أوركشن. إنها لا تفترض نماذج "تعرف كيف تشفير". بدلاً من ذلك، تخلق، بدلاً من ذلك، **الضغط، وتفاعل الآراء، والذاكرة** لذا يمكن للنماذج تحسين الشفرة بشكل تكراري بدلاً من توليدها بشكل مثالي في المحاولة الأولى.

### الهيكل التصميمي

```mermaid
graph TB
    subgraph DiSE["DiSE (Distributed System)"]
        A[Triage Agent] -->|Easy| B[Fast Model - Qwen/Llama]
        A -->|Hard| C[Strong Model - GPT-4o]

        B --> D[Test Suite]
        C --> D

        D -->|Pass| E[Structured Registry]
        D -->|Fail| F{Worth escalating?}

        F -->|Yes| G[Optimizer Agent]
        F -->|No| H[Mark as failed]

        G --> I[Mutation Pipeline]
        I --> D

        E --> J[RAG with usage stats]
        J --> K[Clustering & reranking]
        K --> A
    end

    style D stroke:#10b981,stroke-width:3px
    style E stroke:#3b82f6,stroke-width:3px
    style K stroke:#8b5cf6,stroke-width:3px

    note2[Most tasks never hit expensive models]
    note2 -.-> B
```

الفرق واضح:

دال دال دال دال دال دال القدرة
|------------|---------|------|
□ توليد الشفرة □ GPT-4 / خط أنابيب تدريج متعدد LLLM متعدد LLM
الحكم GPPT-4
□ إعادة استخدام الأداة □ فقط السجلات التي تحتوي على البيانات الفوقية + العلامات + إحصائيات الاستخدام □
□ تحسين GPT-4 يقترح تثبيت خطوط أنابيب التسرّع والطفرة □
DB DB RAG + التجميع + تتبع التطور
□ التكوين □ خطط GPT-4 □ تخطيط رسم بياني لتدفق العمل □ □ □ تخطيط رسم بياني لتدفق العمل □ □
• مراقبة التكاليف - لا يوجد تحديد للأولويات + المنطق التراجعي

## لماذا ديز لا يحتاج GPT-4 (أغلب الوقت)

(السبب) **كل وحدة من الشفرة المُحدثة تُعامل كعملة**ليس رداً فورياً

لا يُحكم عليه بـ "هل يبدو هذا جيداً؟" - بل يُحكم عليه بواسطة:

- هل يركض؟
- هل يحل المهمة؟
- هل هي أسرع من قبل؟
- هل يجتاز جناح الاختبار؟

A رخيص LLLM (Qwen 2.5 coder 7B, Llamaa 3.1 8B) يمكن أن يولّد خمسة متغيرات. الاختبارات تختار أفضل. النموذج الأقوى لا يتدخل إلا عندما يفشل الأضعف.

ومع مرور الوقت، يتعلم النظام النماذج التي هي جيدة لأي من المجالات. كما فعلت مع بلدي [تنفيذ البحث البحثي](/blog/semantic-search-with-onnx-and-qdrant) - أنت لا تحتاج إلى النموذج الأكبر عندما يكون لديك الهندسة المعمارية الصحيحة.

(أ) تصبح عملية الصقل **التطور، ليس التدمير الذاتي الذاتي**.

### الواقع: فرز الر_Gorththms

لنجعل هذا ملموسًا، قل أنك تريد من عميلك تنفيذ الفرز الكفؤ.

**النهج:**

1. GPSP-4 يولد تنفيذ كويك سورت
2. GPPT-4 تقييم إذا كان "نظرات صحيحة"
3. GPPT-4 يديره في البيئة
4. إذا فشل، GPPT-4 يقترح تثبيتات
5. التكلفة: حوالي 0.20.0.30 لكل محاولة

**النهج التوسيسي:**

1. الفرز: "الفرز الفعال للتنفيذ الفعال"
2. Qwen 2.5 مشفر 7B يولد 5 متغيرات (QuickSort, MergeSort, HeapSort, التباينات)
3. تنفيذاتاتات خانة الاختبار لـ 5 ضد:
   - اختبارات تصحيحية (الناتج الناتجرطي، الاستقرار، حالات الحواف)
   - نقاط قياس الأداء (الوقت، الذاكرة)
   - التحليل الثباتي (الجمع، جودة الرموز)
4. يُسجَّل أفضل متغير أداء في سجل مع القياسات
5. التكلفــة: - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -
6. الطلبات المقبلة لاستعادة هذا التنفيذ المثبت في المستقبل
7. إذا احتاج شخص ما في وقت لاحق "ترتيبات الجدول" ، يمكن للمثالي أن يحوّل الرمز الحالي بدلاً من البدء من الصفر

يمكن للنموذج الرخيص أن يستكشف مساحة الحل. الاختبارات تقوم بالاختيار. النموذج الغالي يتدخل فقط إذا فشلت جميع المتغيرات الخمسة.

## ما الذي يعنيه هذا في الممارسة

لقد كنت أختبر مع مبادئ متشابهة في [نظامي الخاص بمدونتي (RAG)](/blog/rag-primer) وقد عقد مؤتمراً بشأن [السمات الاستخباراتية](/blog/semantidintelligence)الـ نمط هو ثابت:

**استخدم النموذج الأكبر للقرارات المعمارية، وليس التنفيذ.**

عندما بنيت [&فكفكفكفكفك](/blog/the-war-on-404) لم استخدم GPT-4 للتحقق من كل وصلة. النظام:

1. طلبات التحقق من صحة الوصلات (لا LLM)
2. يعود إلى بحث البحث السيمدني عند فصل الوصلات (NONNNX نموذج)
3. ينطوي فقط على LLLL إذا فشل البحث الدناتي (الحاجة الماسة)

الإستخبارات الباهظة في التصميم وليس في التنفيذ

## أولاً - المسألة الأساسية

كل نظام يطرح سؤالاً مختلفاً:

**يُمَثِل:**

> هل يمكن لLLLLM تعلم متى تستخدم الأدوات بقياس أي أداة تتصل بالمساعدات في الواقع؟

**يَسْألُ المُسْؤُولُ:**

> هل يمكن لLLLM توليد شفرة قابلة لإعادة الاستخدام تساعد في المهام المستقبلية؟

**يَسِيّل:**

> هل يمكن لنظام توليد الأدوات، تقييمها موضوعياً، تطويرها استناداً إلى نتائج حقيقية، والقيام بكل هذا بكفاءة كافية لتشغيلها في الإنتاج؟

 **أشغال التعلم القائمة على أساس النتائج**.
أُثبتت المُقَرِف **يمكن إعادة استخدام أدوات توليد**.
يُثبت المُسند **يمكن للأدوات أن تتطور باستمرار دون كسر المصرف**.

الدالة هو **- - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -**.
إنّ (الفورافور) هو **لا شيء**.
مُسْس هو ****.

واحد يُظهر أنّه يُمكنك التعلّم من النتائج.
واحد يُظهر أنك تستطيع توليد الأدوات.
ويبني الآخر آلية للتطور المستمر.

## لجنة

إذا كنت تقوم ببناء أنظمة LLLL-Power-نظم اليوم، نهج DISE يقترح:

### 1- التقييم أولاً

لا تُولّد الشفرة و آمل أن تنجح. اكتب اختبارات تعرّف "العمل" كما أفعل من أجل: [(بدولارات الولايات المتحدة الأمريكية)](/blog/efmigrationstherightway) -الاختبارات جارية، أو أنها لا، لا حاجة إلى حكم إل إل إل إل إل إل.

### 2 - Titers Aggurssive

احجز نماذج غالية للمشاكل الصعبة حقاً، محفظتك ستشكرك

### 3 - ما الذي يُجدي؟

الخزن ليس فقط الرمز، ولكن:

- ما الذي تم خلقه من أجل
- ما الذي قام بإنشاء هذا النموذج
- مدى جودة أدائها
- كم عدد المرات التي يتم فيها إعادة استخدامها

هذه البيانات الفوقية تصبح بيانات تدريب لمنطقك

### 4 - تطور الحمل

لا تتوقع الكمال في المحاولة الأولى. قم بتهيئة المتغيرات، اختبرها، حافظ على الفائزين،

هذه هي الطريقة التي أعالج بها التطور في هذه المدونة - كتابة في العلن، [التعلم من حركة المرور الحقيقية](/blog/usingumamidataforwebsitestats)تُحسَّن استناداً إلى الاستخدام الفعلي.

## لماذا هيكل الامور اكثر مما تظن

الفرق بين (فوياجر) و (دي سي) ليس فقط حول التكلفة، بل حول **ماذا يحدث عندما تفشل الأشياء**.

في فوياكر، يعني الفشل ما يلي:

- طلب من GPPGP-4 لتصحيح التنق
- تأمل أن تفهم المشكلة
- تَسْبَحْ 0.0٥ لِأَسْفَر

في DISE، محفزات الفشل:

- تحليل الخطأ الهيكلي (ما إذا فشل، لماذا، ما هو متوقع)
- من بدائل العمل
- التصعيد فقط إذا كانت المشكلة جديدة حقاً
- التعلم في حالات الفشل المتشابهة في المستقبل

النظام يحصل على **أكثر ذكاءً حول ما لا يعرفه**.

## المـستقبل هـي هـي:

لا أعتقد أننا سوف نرى "النموذج الوحيد يفعل كل شيء" النقي الأنظمة تفوز في الإنتاج. الاقتصاد لا يعمل، والأنماط الفاشلة غير واضحة للغاية.

بدلاً من ذلك، سنرى أنظمة هجينة مثل DISE:

- نماذج رخيصة للأنماط الموحدة
- النماذج الباهظة التكلفة للمشكلات الجديدة
- منطق غير LLLLLLG لكل ما عدا ذلك (الاختبارات، القياسات، التحقق)
- نظم الذاكرة التي تتعلم في الواقع من النتائج

نحن نرى هذا النمط في كل مكان:

- [نُظُم نُظُم](/blog/rag-architecture) الجمع بين الاسترجاع + التوليد
- [متعددة العوامل](/blog/workflowsystem-part1-introduction) مع المكونات الخاصة
- [ابحث](/blog/semantic-search-in-action) 

السحر ليس في وجود نموذج رائع واحد، بل في وجود **في الوقت المناسب** مع أن **في سياق**.

## ثالثاً - استنتاج

كان (فوياجر) منارة، أظهر أنّ العوامل يمكن أن تتعلّم عن طريق توليد الشفرة.

الخطوة التالية لم تكن أكثر إثارة هذا النهج يصل لحدوده

الخطوة التالية هي **وضع المرأة**:

- 
- التقييم
- الميراث المنهجي
- 

DISS لا تحاول أن تكون أذكى في طلقة واحدة.
إنه يحاول أن يكون أفضل على ** ** مُطلقاً عليه الرصاص.

هذا الفرق هو حيث يبدأ التطور.

وعلى عكس التطور البيولوجي، ليس علينا أن ننتظر ملايين السنين لنرى النتائج.

---


## لِمَ يَمُ مُتَاحُ مختلف

- **لا حاجة إلى تدقيق الضبط** - العمل مع أي LLL عن طريق API
- **لا تحتاج GPP-4 لكل شيء** - يُخفّضُ التنفيذُ يُخفّضُ التكاليفَ
- **لا يَهُلّسُ تقييمَ** - أدوات الاختبار الموضوعي، وليس الحكم في قضية LLL
- **لا يَرْمِ رمزاً بعيداً** -كل قطعة من القطع يتم تخزينها و نسخها و تعقبها
- **لا ينسى العمل السابق** - المجموعة المرجعية + إحصائيات الاستخدام = الذاكرة المؤسسية
- **لا تخاف من الفشل** - استخدامه كضغط اختيار للتطور

---


## & ما

**ورقات:**

- [عامل مفتوح العضوية لديه نماذج لغوية كبيرة](https://arxiv.org/abs/2305.16291) - الورقة الأصلية
- [](https://arxiv.org/abs/2302.04761) - تدريس الرخص القانونية لاستخدام الأدوات
- [(أ) معاقبت](https://arxiv.org/abs/2210.03629) - الأسباب + نمط التصرّف
- [شجرة الأفكار](https://arxiv.org/abs/2305.10601) - حل المشاكل

**على هذا العنوان:**

- [مبنى نظام RAG](/blog/rag-primer) - الاسترجاع المختلط + معمارية التوليد
- [البحث الدهني مع OONNX وQdrant](/blog/semantic-search-with-onnx-and-qdrant) - مخطوطات بدون رسوم مخفضة
- [الحرب على 404](/blog/the-war-on-404) - نهج معقّد في الربط
- [مُستخدِل لـ محليLLLLs محلي](/blog/reanimation) - نماذج أصغر ذاتية الاستضافة
- [سلسلة مواد البناء](/blog/building-a-lawyer-gpt-for-your-blog-part1) - سلسلة متعدّدة الأجزاء عن المجموعة المُدرجة + المُلَكَّمات المُلَحَّة

**أدوات:**

- [الوليمة](https://ollama.ai/) - تشغيل لالاما، وكوين، ونماذج أخرى محليا
- [Litil Litlish](https://github.com/BerriAI/litellm) - الرقم القياسي الموحد لنسبة 100+ مورِّد الحد الأدنى للأجور
- [LLL تشين تشينLL تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين تشين](https://www.langchain.com/) - إطار لتطبيقات الإدارة المستدامة للأراضي (بالرغم من أنني أميل إلى تجنب أطر العمل الثقيلة)