This is a viewer only at the moment see the article on how this works.
To update the preview hit Ctrl-Alt-R (or ⌘-Alt-R on Mac) or Enter to refresh. The Save icon lets you save the markdown file to disk
This is a preview from the server running through my markdig pipeline
Monday, 24 November 2025
نظامي، ديسي، هو عبارة عن بناية ذاتية الترشيد، ذاتية التجميع، هندسة برامجية قائمة على أساس تدفق العمل. إنه يولّد مشفّرات قابلة للاختبار، يقيّمها بموضوعية، ويطوّرها بمرور الوقت بدون إشراف بشري مستمر. ولكن هنا الأمر: ألم تقم شركة فوياجر -- التي تثير الإعجاب من طراز ماينكرافت من عام 2023 -- بذلك من خلال توليد مهارات قابلة لإعادة الاستخدام؟ ألم تثبت الأداة أن LLMs يمكنها بالفعل أن تتعلم استخدام الأدوات من خلال قياس النتائج؟ إذا كان لدينا بالفعل عملاء يكتبون أدواتهم الخاصة ويتعلمون متى يستخدمونها، أليس نحن بالفعل حللنا مشكلة عوامل التحسين الذاتي؟
لا. وفهم لماذا يهم إذا كنت تبني أي شيء يحتاج إلى تشغيل في الإنتاج.
"هذا يبدو مثل فوياجر ولكن مع خطوات أكثر."
إذا كنت تتبع أبحاث الوكيل الذي يقوده LLLLM، ربما كنت قد سمعت عن الوافور (Wang وآخرون، 2023) - النظام الذي علّم GPT-4 على اللعب بحرف المنجم عن طريق توليد شفرة "مهارة" قابلة لإعادة الاستخدام - و (Schick et al., 2023) - الذي علّم LLLSs على استخدام الأدوات عن طريق قياس النتائج الفعلية.
للوهلة الأولى، قد تبدو DISE (التطور الاصطناعي المقيّد) مثل Foyaager + أداة مع معطف طازج من الطلاء. ولكن هذا مثل القول أن قاعدة بيانات الإنتاج هي مجرد جدول زمني مع خطوات أكثر. الفرق يهم إذا كنت تهتم بالحجم، التكلفة، وفي الواقع شحن شيء ما.
جديد إلى DISS؟ (أ) ما يُخرج منه - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - للصورة الكبيرة، ثم استكشاف سلسلة "الطبخ مع DISE": الجزء الثاني عن الدراسات العليا في مجال التلمذة وقد عقد مؤتمراً بشأن الجزء 3 من الجزء 3 بشأن المنتجات المحدودة غير الجديرة بالثقةيركز هذا المقال على وجه التحديد على كيف تختلف بنية DESE من فوياجر والأداة.
يوضح هذا المقال ما حصل فوياجر وToyfordor الحق، حيث أنها وصلت الحدود، ولماذا النهج المعماري DESE حل المشاكل التي لا يمكن التعامل معها وحدها.
غيرت ورقتان من عام 2023 كيف نفكر في عوامل وأدوات LLM:
قدم فويادر نظرة ثاقبة بالغة الأهمية:
يمكن أن تنتج LLLLS أدوات إعادة استخدام خاصة بها.
بدلاً من الترميز الصلب لكل إجراء في مركبات التعدين، استخدمت فوياجر GPT-4 لكتابة الوظائف على الذبابة. كل إجراء ناجح أصبح مهارة قابلة لإعادة الاستخدام مخزنة في قاعدة بيانات متجهة. كان التنبيه صريحاً:
"وظيفتك سوف يعاد استخدامها لبناء وظائف أكثر تعقيدا. لذلك، يجب أن تجعلها عامة ويمكن إعادة استخدامها."
لأول مرة، قام نظام عامل بمعاملة توليد الأدوات على أنه هندسية برمجيات أظهر (فوياجر) أنّ بإمكان العُملاء:
ونجحت نوعاً ما في صناعة الألغام مع GPT-4
(Schick وآخرون، 2023) اتخذ نهجاً مختلفاً. بدلاً من توليد الأدوات، قام بتدريس LLMs الوقت الذي تدعو فيه الأدوات الموجودة.
الجزء الذكي: طور الأداة بياناته التدريبية الخاصة به.
هذه النماذج المنشأة التي تعلّمت استخدام أداة من المحصلات API حاسبة ترجع الجواب الصحيح أفضل من واحد لا يحتاج - لا حاجة إلى حكم LLLL.
يأخذ DISE أفكاراً من كلتا الورقتين ويعالج ثغراتهما:
من فوياكر:
من مصدر الأداة:
منهج DISS:
فكروا في ديسي على أنها حفيدة رد الفعل، ردود الفعل، الأدوات، والفويجر. كل سلف ساهم بشيء حاسم:
graph TB
ReAct[ReAct 2022:<br/>Reason + Act<br/>Step-by-step thinking] --> DiSE
Reflexion[Reflexion 2023:<br/>Self-critique loops<br/>Try → Reflect → Retry] --> DiSE
Toolformer[Toolformer 2023:<br/>Learn from outcomes<br/>Self-generated training data] --> DiSE
Voyager[Voyager 2023:<br/>Generate reusable tools<br/>Code as memory] --> DiSE
DiSE[DiSE 2024:<br/>Directed Synthetic Evolution]
DiSE --> G[Generate tools with tests]
DiSE --> E[Evaluate objectively]
DiSE --> M[Mutate and improve]
DiSE --> S[Store with usage stats]
DiSE --> R[Retrieve and reuse]
DiSE --> C[Tiered execution]
style ReAct stroke:#8b5cf6,stroke-width:2px
style Reflexion stroke:#ec4899,stroke-width:2px
style Toolformer stroke:#f59e0b,stroke-width:2px
style Voyager stroke:#ef4444,stroke-width:2px
style DiSE stroke:#10b981,stroke-width:3px
الورثة:
ما تضيفه DISE:
AUDEAPR أثبت أنك تستطيع تدريب النماذج على استخدام الأدوات بقياس النتائج الحقيقية. يمكن للعوامل المثبتة أن تبني مكتبات أدواتها الخاصة بها. أثبت ردود الفعل أن حلقات الإنعكاس تعمل. أثبت Refect أن التفكير المهيكل يساعد.
يَسِيّل: ماذا لو جمعنا كل هذه الرؤى، لكن جعلناها رخيصة بما يكفي لتشغيل في الإنتاج وذكية بما فيه الكفاية لتحسين نفسها مع مرور الوقت؟
ونعم، هناك اندفاعة في معمارية RST لروي فيلدنغ في هناك أيضا -- الأدوات هي مصادر حالة مع URIs، و diute، و النسخ. كل أداة قابلة للمعالجة، ومخبأة، ويمكن أن تكون مكونة مع الآخرين. سجل الأداة ليس مجرد قاعدة بيانات متجهة؛ هو مخزن RESTVL حيث الموارد (الأدوات) لها حالة (إحصائياتusage، قياسات الأداء، تاريخ الإصدار) التي تؤثر على كيفية استرجاعها وتطويرها.
هذا ليس تدريباً، هذا ليس جيلاً واحداً من جيل دال - التطور الموجه.
graph TB
subgraph Voyager["Voyager (2023)"]
A[GPT-4] --> B[Generate Code]
B --> C[Execute in Minecraft]
C --> D{Success?}
D -->|Yes| E[Store with embedding]
D -->|No| F[GPT-4 suggests fix]
F --> B
E --> G[Vector DB]
G --> H[Future retrieval]
H --> A
end
style A stroke:#ef4444,stroke-width:3px
style F stroke:#ef4444,stroke-width:3px
note1[All reasoning flows through GPT-4]
note1 -.-> A
انظر المشكلة؟ كل قرار - التخطيط، التقييم، التنقيح، التركيب - يمر من خلال نفس النموذج الحدودي. عندما تحتاج إلى التألق في كل خطوة، تحتاج GPT-4 (أو ما يعادلها) في كل مكان.
فوياجر لم يكن فقط يستخدم GPT-4 لتوليد الكود. لقد اعتمد على GPT-4 في:
عندما يفعل النموذج كل شيء، فإنه يحتاج إلى أن يكون على مستوى الحدود الرائعة في كل مرة.
لهذا السبب (فوياجر) لم يتدرج إلى ما هو أبعد من (ماين كرافت) ولهذا السبب تشغيله في الإنتاج سيكلف ثروة
دعونا نقوم ببعض رياضيات المناديل. لنقل أنك تريد تشغيل نظام أسلوب Voyaager لمهام العالم الحقيقي:
الآن أضف إستفسارات إسترجاع، محاولات تكوين، دورات تصحيح. أنت تنظر بسهولة إلى مئات الدولارات لعميل واحد لبناء مكتبة مهارة معتدلة.
بالنسبة للمقارنة، إليكم ما قد يكلفه النهج المتدرج:
عندما تدعو النموذج الباهظ الثمن فقط للمشاكل الصعبة الحقيقية، الاقتصاد يتغير بشكل كبير.
فَكَانَتِ ٱلْأَسْفَارُ ٱلْمُقَدَّسَةُ وَٱلْمُوَدِّيَّةُ وَٱلرَّجَاءُ لَمْ تَكُنْ فِعْلًا فِي ٱلْأَسْفَارِ ٱلْمُقَدَّسَةِ ٱلْمُقَدَّسَةِ .
وهناك ثلاثة معوقات حالت دون إحراز تقدم في عام 2023:
ما الذي تغير )٢٠٢٤ - ٢٠٢٥( |-------------------|-------------|--------------------------| □ GPT-4 كان المحرك المنطقي الوحيد الموثوق به □ كان على أحد النماذج أن يفعل كل شيء -- GPT-4o + Qwen + DepSeek + Llama o □ كانت التضمينات المحلية ضعيفة أو غير مستعملة □ لا يوجد تقييم منظم يسخر □ LLLM Q LLL TM LLS الآن LLLS تشغيل الشفرة بشكل نظيف عن طريق الحاويات
إذاً (فوياجر) و (الأداة) لا يمكن أن يتطورا.
يمكنهم فقط تسمية النماذج أو النماذج الدقيقة. لم يتمكنوا من توزيع الوعي عبر نظام. لم يتمكنوا من تطبيق ضغط الاختيار.
لقد حلّوا "هل يمكننا؟" سؤال سؤال سؤال.
الدالة DSS "كيف نستمر بالتحسن؟" سؤال سؤال سؤال.
ليس لأنني أذكى من (وانغ) أو (شايك) لكن لأن الأجهزة، الأدوات، والاقتصاد أخيراً
هذه مشكلة هندسية والهندسة هي دائماً مسألة توقيت.
الفكرة الأساسية وراء DISE بسيطة ولكن عميقة:
الهيكل يحل محل التأويل.
بدلاً من توقع نموذج واحد ليفعل كل شيء بشكل مثالي، توزع DISE المشكلة عبر نظام أوركشن. إنها لا تفترض نماذج "تعرف كيف تشفير". بدلاً من ذلك، تخلق، بدلاً من ذلك، الضغط، وتفاعل الآراء، والذاكرة لذا يمكن للنماذج تحسين الشفرة بشكل تكراري بدلاً من توليدها بشكل مثالي في المحاولة الأولى.
graph TB
subgraph DiSE["DiSE (Distributed System)"]
A[Triage Agent] -->|Easy| B[Fast Model - Qwen/Llama]
A -->|Hard| C[Strong Model - GPT-4o]
B --> D[Test Suite]
C --> D
D -->|Pass| E[Structured Registry]
D -->|Fail| F{Worth escalating?}
F -->|Yes| G[Optimizer Agent]
F -->|No| H[Mark as failed]
G --> I[Mutation Pipeline]
I --> D
E --> J[RAG with usage stats]
J --> K[Clustering & reranking]
K --> A
end
style D stroke:#10b981,stroke-width:3px
style E stroke:#3b82f6,stroke-width:3px
style K stroke:#8b5cf6,stroke-width:3px
note2[Most tasks never hit expensive models]
note2 -.-> B
الفرق واضح:
دال دال دال دال دال دال القدرة |------------|---------|------| □ توليد الشفرة □ GPT-4 / خط أنابيب تدريج متعدد LLLM متعدد LLM الحكم GPPT-4 □ إعادة استخدام الأداة □ فقط السجلات التي تحتوي على البيانات الفوقية + العلامات + إحصائيات الاستخدام □ □ تحسين GPT-4 يقترح تثبيت خطوط أنابيب التسرّع والطفرة □ DB DB RAG + التجميع + تتبع التطور □ التكوين □ خطط GPT-4 □ تخطيط رسم بياني لتدفق العمل □ □ □ تخطيط رسم بياني لتدفق العمل □ □ • مراقبة التكاليف - لا يوجد تحديد للأولويات + المنطق التراجعي
(السبب) كل وحدة من الشفرة المُحدثة تُعامل كعملةليس رداً فورياً
لا يُحكم عليه بـ "هل يبدو هذا جيداً؟" - بل يُحكم عليه بواسطة:
A رخيص LLLM (Qwen 2.5 coder 7B, Llamaa 3.1 8B) يمكن أن يولّد خمسة متغيرات. الاختبارات تختار أفضل. النموذج الأقوى لا يتدخل إلا عندما يفشل الأضعف.
ومع مرور الوقت، يتعلم النظام النماذج التي هي جيدة لأي من المجالات. كما فعلت مع بلدي تنفيذ البحث البحثي - أنت لا تحتاج إلى النموذج الأكبر عندما يكون لديك الهندسة المعمارية الصحيحة.
(أ) تصبح عملية الصقل التطور، ليس التدمير الذاتي الذاتي.
لنجعل هذا ملموسًا، قل أنك تريد من عميلك تنفيذ الفرز الكفؤ.
النهج:
النهج التوسيسي:
يمكن للنموذج الرخيص أن يستكشف مساحة الحل. الاختبارات تقوم بالاختيار. النموذج الغالي يتدخل فقط إذا فشلت جميع المتغيرات الخمسة.
لقد كنت أختبر مع مبادئ متشابهة في نظامي الخاص بمدونتي (RAG) وقد عقد مؤتمراً بشأن السمات الاستخباراتيةالـ نمط هو ثابت:
استخدم النموذج الأكبر للقرارات المعمارية، وليس التنفيذ.
عندما بنيت &فكفكفكفكفك لم استخدم GPT-4 للتحقق من كل وصلة. النظام:
الإستخبارات الباهظة في التصميم وليس في التنفيذ
كل نظام يطرح سؤالاً مختلفاً:
يُمَثِل:
هل يمكن لLLLLM تعلم متى تستخدم الأدوات بقياس أي أداة تتصل بالمساعدات في الواقع؟
يَسْألُ المُسْؤُولُ:
هل يمكن لLLLM توليد شفرة قابلة لإعادة الاستخدام تساعد في المهام المستقبلية؟
يَسِيّل:
هل يمكن لنظام توليد الأدوات، تقييمها موضوعياً، تطويرها استناداً إلى نتائج حقيقية، والقيام بكل هذا بكفاءة كافية لتشغيلها في الإنتاج؟
أشغال التعلم القائمة على أساس النتائج. أُثبتت المُقَرِف يمكن إعادة استخدام أدوات توليد. يُثبت المُسند يمكن للأدوات أن تتطور باستمرار دون كسر المصرف.
الدالة هو - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - - -. إنّ (الفورافور) هو لا شيء. مُسْس هو ****.
واحد يُظهر أنّه يُمكنك التعلّم من النتائج. واحد يُظهر أنك تستطيع توليد الأدوات. ويبني الآخر آلية للتطور المستمر.
إذا كنت تقوم ببناء أنظمة LLLL-Power-نظم اليوم، نهج DISE يقترح:
لا تُولّد الشفرة و آمل أن تنجح. اكتب اختبارات تعرّف "العمل" كما أفعل من أجل: (بدولارات الولايات المتحدة الأمريكية) -الاختبارات جارية، أو أنها لا، لا حاجة إلى حكم إل إل إل إل إل إل.
احجز نماذج غالية للمشاكل الصعبة حقاً، محفظتك ستشكرك
الخزن ليس فقط الرمز، ولكن:
هذه البيانات الفوقية تصبح بيانات تدريب لمنطقك
لا تتوقع الكمال في المحاولة الأولى. قم بتهيئة المتغيرات، اختبرها، حافظ على الفائزين،
هذه هي الطريقة التي أعالج بها التطور في هذه المدونة - كتابة في العلن، التعلم من حركة المرور الحقيقيةتُحسَّن استناداً إلى الاستخدام الفعلي.
الفرق بين (فوياجر) و (دي سي) ليس فقط حول التكلفة، بل حول ماذا يحدث عندما تفشل الأشياء.
في فوياكر، يعني الفشل ما يلي:
في DISE، محفزات الفشل:
النظام يحصل على أكثر ذكاءً حول ما لا يعرفه.
لا أعتقد أننا سوف نرى "النموذج الوحيد يفعل كل شيء" النقي الأنظمة تفوز في الإنتاج. الاقتصاد لا يعمل، والأنماط الفاشلة غير واضحة للغاية.
بدلاً من ذلك، سنرى أنظمة هجينة مثل DISE:
نحن نرى هذا النمط في كل مكان:
السحر ليس في وجود نموذج رائع واحد، بل في وجود في الوقت المناسب مع أن في سياق.
كان (فوياجر) منارة، أظهر أنّ العوامل يمكن أن تتعلّم عن طريق توليد الشفرة.
الخطوة التالية لم تكن أكثر إثارة هذا النهج يصل لحدوده
الخطوة التالية هي وضع المرأة:
-
DISS لا تحاول أن تكون أذكى في طلقة واحدة. إنه يحاول أن يكون أفضل على ** ** مُطلقاً عليه الرصاص.
هذا الفرق هو حيث يبدأ التطور.
وعلى عكس التطور البيولوجي، ليس علينا أن ننتظر ملايين السنين لنرى النتائج.
ورقات:
على هذا العنوان:
أدوات:
© 2026 Scott Galloway — Unlicense — All content and source code on this site is free to use, copy, modify, and sell.