# "Δεν είναι το DiSE Just Voyager;" -Γιατί η δομή νικάει την Brilliance

<!--category-- AI, Machine Learning, LLMs, Code Generation -->
<datetime class="hidden">2025-11-24T18:00</datetime>

Το σύστημά μου, το DiSE, είναι ένα αυτο-βελτιωτικό, αυτο-συναρμολόγηση, λογισμικό μηχανικός γειωμένο οικοδόμος ροής εργασίας. Δημιουργεί δοκιμασμένα αντικείμενα κώδικα, τα αξιολογεί αντικειμενικά, και τα εξελίσσεται με την πάροδο του χρόνου χωρίς συνεχή ανθρώπινη εποπτεία. Αλλά εδώ είναι το πράγμα: δεν Voyager ότι εντυπωσιακό Minecraft bot από το [23]Κάθε φορά το κάνουμε αυτό δημιουργώντας επαναχρησιμοποίητες δεξιότητες; Και δεν Toolformer ήδη αποδεικνύει ότι LLMs θα μπορούσε να μάθουν να χρησιμοποιούν εργαλεία με τη μέτρηση των αποτελεσμάτων; Αν έχουμε ήδη πράκτορες που γράφουν τα δικά τους εργαλεία και να μάθουν πότε να τα χρησιμοποιούν, δεν έχουμε ήδη λύσει το πρόβλημα της αυτο-βελτίωσης των παραγόντων AI;

Σπόιλερ: Όχι, και καταλαβαίνω γιατί μετράει αν φτιάχνεις κάτι που πρέπει να τρέξει στην παραγωγή.

## Εισαγωγή

"Αυτό ακούγεται σαν το Βόγιατζερ αλλά με περισσότερα βήματα."

Σωστά, αν παρακολουθούσες την έρευνα του πράκτορα της LLM, πιθανότατα να έχεις ακούσει για την [ΒόγιατζερCity name (optional, probably does not need a translation)](https://arxiv.org/abs/2305.16291) (Wang et al., 2023) - το σύστημα που δίδαξε την GPT-4 να παίζει Minecraft δημιουργώντας επαναχρησιμοποίητο κώδικα "skills" - και [Εργαλειοδότης](https://arxiv.org/abs/2302.04761) (Schick et al., 2023) - η οποία δίδαξε LLMs να χρησιμοποιούν εργαλεία με τη μέτρηση των πραγματικών αποτελεσμάτων.

Με την πρώτη ματιά, το DiSE (Directed Synthetic Evolution) μπορεί να μοιάζει με Voyager + Toolformer με ένα φρέσκο χρώμα. Αλλά αυτό είναι σαν να λες ότι μια βάση δεδομένων παραγωγής είναι απλά ένα λογιστικό φύλλο με περισσότερα βήματα.

> **Καινούριος στο DiSE;** Ελέγξτε έξω [Το γήπεδο του ασανσέρ μου.](/blog/elevatorpitch) για τη μεγάλη εικόνα, στη συνέχεια, εξερευνήστε τη σειρά "Cooking with DiSE": [Μέρος 2 για τα μεταπτυχιακά μαθήματα](/blog/blog-article-cooking-dise-part2-apprenticeships) και [Μέρος 3 για τις μη αξιόπιστες LLMs](/blog/blog-article-cooking-dise-part3-untrustworthy-gods). Αυτή η δημοσίευση επικεντρώνεται ειδικά στο πώς η αρχιτεκτονική του DiSE διαφέρει από το Voyager και το Toolformer.

Αυτό το άρθρο εξηγεί τι Βόγιατζερ και Toolformer πήρε δεξιά, όπου έφτασαν τα όρια, και γιατί η αρχιτεκτονική προσέγγιση του DiSE λύνει προβλήματα που ούτε θα μπορούσε να αντιμετωπίσει μόνη της.

[TOC]

## Τι Έκαναν καλά το Βόγιατζερ και ο Εργαλειογράφος

Δύο έγγραφα από το 2023 άλλαξαν τον τρόπο σκέψης μας για τους παράγοντες LLM και τα εργαλεία:

### Voyager: Πράκτορες μπορούν να δημιουργήσουν εργαλεία

Το Βόγιατζερ εισήγαγε μια κρίσιμη διορατικότητα:

**Τα LLM μπορούν να δημιουργήσουν τα δικά τους εργαλεία που μπορούν να χρησιμοποιηθούν.**

Αντί για σκληρή κωδικοποίηση κάθε δράσης στο Minecraft, το Voyager χρησιμοποίησε GPT-4 για να γράψει λειτουργίες στη μύγα. Κάθε επιτυχημένη δράση έγινε μια επαναχρησιμοποίητη ικανότητα αποθηκευμένη σε μια διανυσματική βάση δεδομένων.

> "Η λειτουργία σας θα χρησιμοποιηθεί για την κατασκευή πιο περίπλοκων λειτουργιών. Ως εκ τούτου, θα πρέπει να το κάνετε γενικό και επαναχρησιμοποίητο."

Αυτό ήταν σημαντικό. Για πρώτη φορά, μια παραγωγή εργαλείων επεξεργασίας συστήματος παραγόντων ως **πραγματική μηχανική λογισμικού** Το Βόγιατζερ έδειξε ότι οι πράκτορες μπορούν:

- Κατασκευή μιας αυξανόμενης βιβλιοθήκης δεξιοτήτων με την πάροδο του χρόνου
- Συγκρίνετε απλές δεξιότητες σε περίπλοκες συμπεριφορές
- Αποφύγετε την καταστροφική ξεχασμένη μέσω της ενσωμάτωσης-βασισμένη στην ανάκτηση

Και δούλεψε, περίπου στο Minecraft, με GPT-4.

### Εργαλείο: Πράκτορες μπορούν να μάθουν πότε να χρησιμοποιούν εργαλεία

[Εργαλειοδότης](https://arxiv.org/abs/2302.04761) (Schick et al., 2023) πήρε μια διαφορετική προσέγγιση. Αντί να παράγει εργαλεία, δίδαξε LLMs **πότε να καλέσετε τα υπάρχοντα εργαλεία**.

Το έξυπνο κομμάτι: Toolformer δημιούργησε τα δικά του δεδομένα κατάρτισης.

1. Εισαγωγή πιθανών κλήσεων εργαλείων στο κείμενο ("ίσως πρέπει να χρησιμοποιήσω έναν υπολογιστή εδώ;")
2. Στην πραγματικότητα να εκτελέσει αυτά τα εργαλεία
3. Κρατήστε τα παραδείγματα όπου τα εργαλεία βοήθησαν, απορρίψτε όπου δεν το έκαναν
4. Fine-tune για τα επιτυχημένα παραδείγματα

Αυτό δημιούργησε μοντέλα που έμαθαν τη χρήση εργαλείων από **αντικειμενικά αποτελέσματα** Μια αριθμομηχανή API που επιστρέφει τη σωστή απάντηση είναι καλύτερη από εκείνη που δεν - καμία κρίση LLM δεν χρειάζεται.

### Πώς το DiSE συνδυάζει και τα δύο (Και προχωράει περαιτέρω)

Το DiSE παίρνει πληροφορίες και από τις δύο εφημερίδες, αλλά αντιμετωπίζει τα κενά τους:

**Από το Βόγιατζερ:**

- □ Δημιουργία επαναχρησιμοποιήσιμων αντικειμένων κώδικα
- Αποθηκεύστε τα για μελλοντική ανάκτηση
- Αλλά πρόσθεσε: Στοχεύουμε τα τεστ, όχι μόνο "δουλεύει στο Minecraft;"
- Αλλά προσθέστε: Tiered μοντέλα αντί για GPT-4 για τα πάντα
- Αλλά προσθέστε: Μεταλλάξεις και εξέλιξη, όχι μόνο αποθήκευση

**Από Toolformer:**

- Μάθετε από αντικειμενικά αποτελέσματα
- □ Δημιουργήστε αυτόματα τα δεδομένα εκπαίδευσης
- Αλλά προσθέστε: Εξέλιξη του χρόνου λειτουργίας, όχι μόνο κατάρτιση-χρόνος μάθησης
- Αλλά προσθέστε: Δημιουργήστε τα εργαλεία από μόνα τους, όχι απλά μάθετε να τα αποκαλείτε
- Αλλά προσθέστε: Πλήρης κύκλος ζωής - εργαλεία μπορούν να βελτιωθούν, όχι μόνο να χρησιμοποιηθούν

**Γενεαλογία του DiSE:**

Σκεφτείτε το DiSE ως το εγγόνι των ReAct, Reflexion, Toolformer, και Voyager. Κάθε πρόγονος συνέβαλε σε κάτι κρίσιμο:

```mermaid
graph TB
    ReAct[ReAct 2022:<br/>Reason + Act<br/>Step-by-step thinking] --> DiSE
    Reflexion[Reflexion 2023:<br/>Self-critique loops<br/>Try → Reflect → Retry] --> DiSE
    Toolformer[Toolformer 2023:<br/>Learn from outcomes<br/>Self-generated training data] --> DiSE
    Voyager[Voyager 2023:<br/>Generate reusable tools<br/>Code as memory] --> DiSE

    DiSE[DiSE 2024:<br/>Directed Synthetic Evolution]

    DiSE --> G[Generate tools with tests]
    DiSE --> E[Evaluate objectively]
    DiSE --> M[Mutate and improve]
    DiSE --> S[Store with usage stats]
    DiSE --> R[Retrieve and reuse]
    DiSE --> C[Tiered execution]

    style ReAct stroke:#8b5cf6,stroke-width:2px
    style Reflexion stroke:#ec4899,stroke-width:2px
    style Toolformer stroke:#f59e0b,stroke-width:2px
    style Voyager stroke:#ef4444,stroke-width:2px
    style DiSE stroke:#10b981,stroke-width:3px
```

**Η κληρονομιά:**

- **Επανεκκίνηση** → Δομημένη συλλογιστική με βρόχους παρατήρησης δράσης
- **Αντανακλαστικό** → Αυτοβελτίωση μέσω προβληματισμού (αλλά η LLM κρίνει την ίδια)
- **Εργαλειοδότης** → Μάθετε από τα πραγματικά αποτελέσματα, όχι μόνο υποκινεί
- **ΒόγιατζερCity name (optional, probably does not need a translation)** → Δημιουργία και αποθήκευση επαναχρησιμοποιήσιμων αντικειμένων κώδικα

**Τι προσθέτει το DiSE:**

- Αντικειμενικοί ιμάντες δοκιμής (όχι αυτοκριτική LLM)
- Εξέλιξη του χρόνου λειτουργίας (όχι μόνο χρόνος κατάρτισης)
- Tiered εκτέλεση μοντέλο (cheap → ακριβό μόνο όταν χρειάζεται)
- Πλήρης κύκλος ζωής εργαλείο (γέννηση → μετάλλαξη → κληρονομιά → θάνατος)
- Βελούδιες ανατροφοδότησης βελτιστοποίησης κόστους
- Stateful μητρώο εργαλείων (ένα κομμάτι της αρχιτεκτονικής REST του Fielding - εργαλεία ως αποδέκτες πόρων με το κράτος)

Toolformer απέδειξε ότι θα μπορούσε να εκπαιδεύσει τα μοντέλα για τη χρήση εργαλείων με τη μέτρηση των πραγματικών αποτελεσμάτων. Voyager απέδειξε παράγοντες θα μπορούσε να κατασκευάσει τις δικές τους βιβλιοθήκες εργαλείων.

Το DiSE ρωτάει: **Τι γίνεται αν συνδυάσουμε όλες αυτές τις ιδέες, αλλά κάναμε αρκετά φθηνή για να τρέξει στην παραγωγή και αρκετά έξυπνη για να βελτιωθεί με την πάροδο του χρόνου;**

Και ναι, υπάρχει μια παύλα της αρχιτεκτονικής REST του Roy Fielding εκεί μέσα πάρα πολύ - τα εργαλεία είναι stateful πόρους με URIs, μεταδεδομένα, και έκδοση. Κάθε εργαλείο είναι στοχευμένο, κρυφό, και μπορεί να συντεθεί με άλλους. Το μητρώο εργαλείων δεν είναι μόνο μια βάση δεδομένων διανυσματικά? είναι ένα Restful κατάστημα όπου οι πόροι (εργαλεία) έχουν κατάσταση (στατικά χρήσης, επιδόσεις, ιστορία έκδοσης) που επηρεάζει το πώς ανακτώνται και εξελιχθεί.

Αυτό δεν είναι εκπαίδευση, δεν είναι μόνο μια γενιά. **directed evolution**.

### Η Αρχιτεκτονική του Βόγιατζερ

```mermaid
graph TB
    subgraph Voyager["Voyager (2023)"]
        A[GPT-4] --> B[Generate Code]
        B --> C[Execute in Minecraft]
        C --> D{Success?}
        D -->|Yes| E[Store with embedding]
        D -->|No| F[GPT-4 suggests fix]
        F --> B
        E --> G[Vector DB]
        G --> H[Future retrieval]
        H --> A
    end

    style A stroke:#ef4444,stroke-width:3px
    style F stroke:#ef4444,stroke-width:3px

    note1[All reasoning flows through GPT-4]
    note1 -.-> A
```

Βλέπετε το πρόβλημα; Κάθε απόφαση - σχεδιασμός, αξιολόγηση, αποσφαλμάτωση, σύνθεση - περνάει από το ίδιο μοντέλο συνόρων. Όταν χρειάζεστε ευφυΐα σε κάθε βήμα, χρειάζεστε GPT-4 (ή ισοδύναμο) παντού.

## Τι Κράτησε το Βόγιατζερ πίσω

Το Βόγιατζερ δεν χρησιμοποιούσε μόνο το GPT-4 για την παραγωγή κώδικα.

- **Σχεδιασμός** - Διαλύοντας υψηλού επιπέδου γκολ σε υπο-δοκιμές
- **Αξιολόγηση** - Αποφασίζει αν μια επιδεξιότητα λειτούργησε σωστά
- **Αποσύνθεση** - Ανακαλύπτοντας ποιες υπάρχουσες δεξιότητες θα συνδυαστούν
- **Ονόματα** - Δημιουργία περιγραφικών αναγνωριστικών κωδικών για αποθήκευση
- **Επιλογή** - Επιλέγοντας τη σωστή ικανότητα από την ενσωμάτωση
- **Κρίση piοιότητα** - Αποφασίζει τι είναι "αρκετά καλό"

Όταν το μοντέλο κάνει τα πάντα, πρέπει να είναι πανέξυπνο κάθε φορά.

Γι' αυτό ακριβώς το Βόγιατζερ δεν σκαρφάλωσε πέρα από το Minecraft... και γι' αυτό το τρέξιμο στην παραγωγή θα κόστιζε μια περιουσία.

### Το Πρόβλημα του Κόστους

Ας κάνουμε μερικά μαθηματικά χαρτοπετσέτας.

- GPT-4 Turbo: ~$0,01 ανά μάρκα εισόδου 1K, ~$0,03 ανά μάρκα εξόδου 1K
- Τυπική παραγωγή δεξιοτήτων: ~2K εισόδου + 1K εξόδου = $ 0.05
- 100 δεξιότητες με 3 προσπάθειες επαναπροσπάθειας το καθένα = ~300 κλήσεις = **$15**
- Αυτό είναι μόνο το αρχικό κτίριο της βιβλιοθήκης.

Τώρα προσθέστε ερωτήματα ανάκτησης, απόπειρες σύνθεσης, κύκλους αποσφαλμάτωσης.

Για σύγκριση, εδώ είναι τι μια κλιμακωτή προσέγγιση μπορεί να κοστίσει:

Βόγιατζερ (GPT-4) Ντίσε (Tiered) - Αποταμίευση
|------|-----------------|---------------|---------|
Δραστηριότητα/δρομολόγηση $0.05 $0.01 (Llama 3.1 8B) &gt; 98%
Αρχική γενιά $0,05 $ $0.02 (Qwen 2.5 Κωδικοποιητής)
Αξιολόγηση $05 $0 (στατικές δοκιμές)
Εκτόξευση (10%) $0,05 $ (GPT- 4o) $0,05 (GPT- 4o)
| **Μέσος όρος ανά εργασία** | **$0.20** | **$0.016** | **92%** |

Όταν αποκαλείτε μόνο το ακριβό μοντέλο για πραγματικά σκληρά προβλήματα, τα οικονομικά αλλάζουν δραματικά.

## Γιατί το DiSE δεν ήταν δυνατό το 2023 (Αλλά είναι τώρα)

Το Βόγιατζερ, ο Εργαλειογράφος και το Αντανακλαστικό δεν ήταν αποτυχίες, απλά χτύπησαν το τεχνικό και οικονομικό ανώτατο όριο της στιγμής τους.

Τρεις περιορισμοί εμπόδισαν την πρόοδο το 2023:

Ο περιορισμός (2023) Συνέπεια Τι άλλαξε (2024)
|-------------------|-------------|--------------------------|
Το GPT-4 ήταν ο μόνος αξιόπιστος κινητήρας συλλογισμού. Ένα μοντέλο έπρεπε να κάνει τα πάντα.
Οι τοπικές ενδυμασίες ήταν αδύναμες ή αχρησιμοποίητες η ανάκτηση ήταν ακριβή η BGE / Αρκτική / MiniLM για τις καταναλωτικές GPUs
Δεν υπάρχει δομημένη ζώνη αξιολόγησης . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . . .

**Οπότε το Βόγιατζερ και ο Εργαλειογράφος δεν μπορούσαν να εξελιχθούν.**

Θα μπορούσαν να καλέσουν μόνο μοντέλα ή μοντέλα λεπτής τύχης.
Δεν μπορούσαν να διανείμουν τη νοημοσύνη σε ένα σύστημα.
Δεν μπορούσαν να ασκήσουν πίεση επιλογής.

Έλυσαν το **"Μπορούμε;"** Ερώτηση.

DiSE λύνει το **"Πώς βελτιωνόμαστε;"** Ερώτηση.

Όχι επειδή είμαι πιο έξυπνος από τον Wang ή τον Schick - αλλά επειδή το υλικό, το εργαλείο, και τα οικονομικά τελικά πρόλαβαν.

**Αυτό είναι ένα μηχανικό πρόβλημα.**
Και η μηχανική είναι πάντα θέμα συγχρονισμού.

## Η Βασική Διαφορά του DiSE

Η βασική ιδέα πίσω από το DiSE είναι απλή αλλά βαθιά:

**Η δομή αντικαθιστά την ευφυΐα.**

Αντί να περιμένει ένα μοντέλο να κάνει τα πάντα τέλεια, DiSE διανέμει το πρόβλημα σε ένα σύστημα ενορχήστρωσης. **πίεση, ανατροφοδότηση, και μνήμη** έτσι τα μοντέλα μπορούν να βελτιώσουν τον κώδικα iterally αντί να τον παράγουν τέλεια στην πρώτη προσπάθεια.

### Αρχιτεκτονική DiSE

```mermaid
graph TB
    subgraph DiSE["DiSE (Distributed System)"]
        A[Triage Agent] -->|Easy| B[Fast Model - Qwen/Llama]
        A -->|Hard| C[Strong Model - GPT-4o]

        B --> D[Test Suite]
        C --> D

        D -->|Pass| E[Structured Registry]
        D -->|Fail| F{Worth escalating?}

        F -->|Yes| G[Optimizer Agent]
        F -->|No| H[Mark as failed]

        G --> I[Mutation Pipeline]
        I --> D

        E --> J[RAG with usage stats]
        J --> K[Clustering & reranking]
        K --> A
    end

    style D stroke:#10b981,stroke-width:3px
    style E stroke:#3b82f6,stroke-width:3px
    style K stroke:#8b5cf6,stroke-width:3px

    note2[Most tasks never hit expensive models]
    note2 -.-> B
```

Η διαφορά είναι σταρκ:

Βόγιατζερ Ντίσε
|------------|---------|------|
Αγωγός πολλαπλών LLM με βάση τα πρότυπα GPT-4
Η αξιολόγηση της GPT-4 κρίνει ότι είναι μη-LLM δοκιμές, μετρικές
□ Επαναχρησιμοποίηση εργαλείων Μόνο ενδυμασίες Καταχώριση με μεταδεδομένα + ετικέτες + στατιστικά χρήσης
Η βελτίωση του GPT-4 προτείνει διορθώσεις στους αγωγούς Escalation & μετάλλαξης
Θυμηθείτε το Vector DB RAG + clustering + evolution tracking
Σύνθεση Συνθέσεις GPT-4 σχέδια □ Σχεδιασμός γραφημάτων ροής εργασίας
Ο έλεγχος κόστους δεν είναι κανένας Προτεραιότητα + λογική υποχώρησης

## Γιατί το DiSE δεν χρειάζεται GPT-4 (Περισσότερο από το χρόνο)

Επειδή **Κάθε μονάδα κώδικα που παράγεται αντιμετωπίζεται ως τεχνούργημα**, δεν είναι μια άμεση απάντηση .

Δεν κρίνεται από το "Μοιάζει καλό αυτό;" - Κρίνεται από:

- Τρέχει;
- Λύνει την αποστολή;
- Είναι πιο γρήγορο από πριν;
- Περνάει από την δοκιμαστική σουίτα;

Ένα φθηνό LLM (Qwen 2.5 Coder 7B, Llama 3.1 8B) μπορεί να δημιουργήσει πέντε παραλλαγές. Οι δοκιμές επιλέγουν το καλύτερο.

Με τον καιρό, το σύστημα μαθαίνει ποια μοντέλα είναι καλά για ποιους τομείς. [Σημαντική εφαρμογή αναζήτησης](/blog/semantic-search-with-onnx-and-qdrant) Δεν χρειάζεσαι το μεγαλύτερο μοντέλο όταν έχεις τη σωστή αρχιτεκτονική.

Η διαδικασία βελτίωσης γίνεται **εξελικτική, όχι αυτοκαταστροφική**.

### Πραγματικό παράδειγμα: Ταξινόμηση αλγορίθμων

Πες ότι θέλεις ο ατζέντης σου να εφαρμόσει αποτελεσματική διαλογή.

**Πλησίασε το Βόγιατζερ:**

1. GPT-4 δημιουργεί την εφαρμογή QuickSort
2. Η GPT-4 αξιολογεί αν "φαίνεται σωστή"
3. GPT-4 τρέχει στο περιβάλλον
4. Αν αποτύχει, το GPT-4 προτείνει διορθώσεις
5. Κόστος: ~$0.20-0.30 ανά προσπάθεια

**Προσέγγιση DiSE:**

1. Δοκιμασία: "συμπληρώστε την αποτελεσματική διαλογή" → δρομολογείται στη γενική βαθμίδα
2. Qwen 2.5 Coder 7B δημιουργεί 5 παραλλαγές (QuickSort, ΣυγχώνευσηSort, HeapSort, παραλλαγές)
3. Η δοκιμαστική σουίτα τρέχει και τις 5 ενάντια:
   - Δοκιμές ορθότητας (διαβαθμισμένη έξοδος, σταθερότητα, ακραίες περιπτώσεις)
   - Κριτήρια αναφοράς επιδόσεων (χρόνος, μνήμη)
   - Στατική ανάλυση (πυκνότητα, ποιότητα κωδικού)
4. Καλύτερη απόδοση παραλλαγή πηγαίνει στο μητρώο με μετρήσεις
5. Κόστος: ~$0,002-0,005
6. Οι μελλοντικές αιτήσεις για "τοποθέτηση" ανακτούν αυτή την αποδεδειγμένη εφαρμογή
7. Αν κάποιος χρειάζεται αργότερα "σταθερή διαλογή," ο βελτιστοποιητής μπορεί να μεταλλάξει τον υπάρχοντα κώδικα αντί να ξεκινήσει από το μηδέν

Το φτηνό μοντέλο μπορεί να εξερευνήσει το χώρο λύσης. Οι δοκιμές κάνουν την επιλογή. Το ακριβό μοντέλο εμπλέκεται μόνο αν και οι 5 παραλλαγές αποτύχουν.

## Τι Σημαίνει αυτό στην Πρακτική

Πειραματιζόμουν με παρόμοιες αρχές. [Το σύστημα RAG του blog μου](/blog/rag-primer) και [σημασιολογικά χαρακτηριστικά νοημοσύνης](/blog/semantidintelligence)Το μοτίβο είναι συνεπές:

**Χρησιμοποιήστε το μεγαλύτερο μοντέλο για αποφάσεις αρχιτεκτονικής, όχι εκτέλεση.**

Όταν έφτιαξα το [χειριστής σπασμένων συνδέσμωνName](/blog/the-war-on-404) Με σημασιολογική απόκλιση αναζήτησης, δεν χρησιμοποίησα GPT-4 για να ελέγξω κάθε σύνδεσμο.

1. Χρησιμοποιεί απλά αιτήματα HEAD για τον έλεγχο της εγκυρότητας των συνδέσμων (όχι LLM)
2. Πέφτει πίσω στη σημασιολογική αναζήτηση όταν σπάνε οι σύνδεσμοι (μοντέλο ONNX)
3. Περιλαμβάνει μόνο ένα LLM εάν η σημασιολογική αναζήτηση αποτύχει (σπάνια απαιτείται)

Η ακριβή νοημοσύνη είναι στο σχέδιο, όχι στην εκτέλεση.

## Το βασικό ερώτημα

Κάθε σύστημα θέτει μια διαφορετική ερώτηση:

**Ο συνεργάτης εργαλείων ρωτάει:**

> Μπορεί ένα LLM να μάθει πότε να χρησιμοποιεί εργαλεία με τη μέτρηση ποιο εργαλείο καλεί πραγματικά να βοηθήσει;

**Το Βόγιατζερ ρωτάει:**

> Μπορεί ένα LLM να δημιουργήσει επαναχρησιμοποίησιμο κώδικα που βοηθά σε μελλοντικές εργασίες;

**Το DiSE ρωτάει:**

> Μπορεί ένα σύστημα να δημιουργήσει εργαλεία, να τα αξιολογήσει αντικειμενικά, να τα αναπτύξει με βάση πραγματικά αποτελέσματα, και να κάνει όλα αυτά αρκετά αποτελεσματικά για να τρέξει στην παραγωγή;

Αποδείχθηκε ο Εργαλειοδότης **Μαθησιακά έργα βασισμένα σε αποτελέσματα**.
Το Βόγιατζερ απέδειξε **Τα εργαλεία που παράγονται μπορούν να επαναχρησιμοποιούνται**.
DiSE αποδεικνύει **εργαλεία μπορούν να εξελιχθούν συνεχώς χωρίς να σπάσει η τράπεζα**.

Toolformer είναι **Χρόνος εκπαίδευσης**.
Το Βόγιατζερ είναι **φλας**.
Το DiSE είναι **υποδομή**.

Κάποιος δείχνει ότι μπορείς να μάθεις από τα αποτελέσματα.
Το ένα δείχνει ότι μπορείς να δημιουργήσεις εργαλεία.
Το άλλο κατασκευάζει μηχανήματα για συνεχή εξέλιξη.

## Πρακτικές Επιπλοκές

Αν φτιάχνεις συστήματα LLM σήμερα, η προσέγγιση του DiSE υποδεικνύει:

### 1. Να οικοδομήσουμε πρώτα την αξιολόγηση

Μην δημιουργείς κώδικα και ελπίζεις να πετύχει. [Μετανάστες πλαισίου οντότητας μου](/blog/efmigrationstherightway) Δεν χρειάζεται κρίση LLM.

### 2. Χρησιμοποιήστε Επιθετικά Βαθμίδες

Διαδρομή απλές εργασίες σε φτηνά μοντέλα. Κρατήστε ακριβά μοντέλα για πραγματικά σκληρά προβλήματα. Το πορτοφόλι σας θα σας ευχαριστήσει.

### 3. Παρακολουθήστε τι λειτουργεί

Αποθηκεύστε όχι μόνο τον κωδικό, αλλά:

- Ποιος ήταν ο λόγος για τον οποίο δημιουργήθηκε
- Ποιο μοντέλο το δημιούργησε
- Πόσο καλά τα πήγες.
- Πόσο συχνά ξαναχρησιμοποιείται

Αυτό το μεταδεδομένα γίνεται δεδομένα εκπαίδευσης για τη λογική δρομολόγησης σας.

### 4. Αγκαλιάστε την εξέλιξη

Μην περιμένετε τελειότητα στην πρώτη προσπάθεια. Δημιουργήστε παραλλαγές, δοκιμάστε τους, κρατήστε τους νικητές, μεταλλάξτε τους καλούς-αλλά-όχι-τέλειους.

Έτσι πλησιάζω την ανάπτυξη σε αυτό το blog - έρημο δημόσια, [μάθετε από την πραγματική κυκλοφορία](/blog/usingumamidataforwebsitestats), να βελτιωθεί με βάση την πραγματική χρήση.

## Γιατί η Δομή Έχει Περισσότερο Σημασία από Ό, τι Σκέφτεστε

Η διαφορά μεταξύ του Βόγιατζερ και του Ντίσι δεν είναι μόνο το κόστος. **τι συμβαίνει όταν τα πράγματα αποτυγχάνουν**.

Στο Βόγιατζερ, η αποτυχία σημαίνει:

- Ζητήστε GPT-4 για αποσφαλμάτωση
- Ελπίζω να καταλαβαίνει το πρόβλημα.
- Πληρώστε $0,05 για το προνόμιο

Στο DiSE, πυροδοτεί βλάβη:

- Δομημένη ανάλυση σφαλμάτων (τι απέτυχε, γιατί, τι αναμενόταν)
- Μεταλλακτική παραγωγή από εναλλακτικές λύσεις εργασίας
- Κλιμάκωση μόνο εάν το πρόβλημα είναι πραγματικά νεωτεριστικό
- Μαθαίνοντας για μελλοντικές παρόμοιες αποτυχίες

Το σύστημα παίρνει **Πιο έξυπνο για ό,τι δεν ξέρει.**.

## Το Μέλλον Είναι Υβριδικό

Δεν νομίζω ότι θα δούμε καθαρά "το ενιαίο μοντέλο κάνει τα πάντα" συστήματα κερδίζουν στην παραγωγή. Τα οικονομικά δεν λειτουργούν, και οι τρόποι αποτυχίας είναι πολύ αδιαφανείς.

Αντ' αυτού, θα δούμε υβριδικά συστήματα όπως το DiSE:

- Φτηνά μοντέλα για κοινά πρότυπα
- Ακριβά μοντέλα για νέα προβλήματα
- Μη-LLM λογική για όλα τα άλλα (δοκιμές, μετρήσεις, επικύρωση)
- Συστήματα μνήμης που πραγματικά μαθαίνουν από τα αποτελέσματα

Βλέπουμε αυτό το μοτίβο παντού:

- [Συστήματα ΚΓΠΕ](/blog/rag-architecture) Συνδυάζοντας ανάκτηση + παραγωγή
- [Ροές εργασίας πολλών παραγόντων](/blog/workflowsystem-part1-introduction) με εξειδικευμένα συστατικά
- [Σημασιολογική αναζήτηση](/blog/semantic-search-in-action) με χρήση προσθηκών + επανασχεδιασμού

Η μαγεία δεν είναι στο να έχεις ένα λαμπρό μοντέλο. **σωστό μοντέλο τη σωστή στιγμή** με το **σωστό πλαίσιο**.

## Συμπέρασμα

Το Βόγιατζερ ήταν φάρος, έδειξε ότι οι πράκτορες μπορούσαν να μάθουν δημιουργώντας κώδικα.

Το επόμενο βήμα δεν ήταν πιο ενθαρρυντικό, η προσέγγιση αυτή φτάνει στα όριά της.

Το επόμενο βήμα είναι **κατευθυνόμενη συνθετική εξέλιξη**:

- Εκλεπτυσμένη παραλλαγή
- Στοχευόμενη αξιολόγηση
- Συστηματική κληρονομιά
- Διαρθρωτική μάθηση

Το DiSE δεν προσπαθεί να είναι πιο έξυπνο με μία μόνο βολή.
Προσπαθεί να είναι καλύτερα στο **Επόμενο** Πυροβόλησε.

Αυτή η διαφορά είναι όπου αρχίζει η εξέλιξη.

Και σε αντίθεση με τη βιολογική εξέλιξη, δεν χρειάζεται να περιμένουμε εκατομμύρια χρόνια για να δούμε αποτελέσματα.

---


## Γιατί η Διάθεσις Είναι Διαφορετική

- **Δεν χρειάζεται λεπτεπίλεπτη ρύθμιση.** - Λειτουργεί με οποιαδήποτε LLM μέσω API
- **Δεν χρειάζεται GPT-4 για όλα** - Tiered εκτέλεση διατηρεί το κόστος προς τα κάτω
- **Δεν έχει παραισθήσεις.** - Αντικειμενικοί ιμάντες δοκιμής, όχι κρίση LLM
- **Δεν πετάει κώδικα.** - Κάθε τεχνούργημα είναι αποθηκευμένο, εκδοθέν, εντοπίστηκε
- **Δεν ξεχνάει την παλιά δουλειά.** - RAG + στατιστικά χρήσης = θεσμική μνήμη
- **Δεν φοβάται την αποτυχία.** - Το χρησιμοποιεί ως πίεση επιλογής για την εξέλιξη

---


## Περαιτέρω Ανάγνωση

**Χαρτιά:**

- [Βόγιατζερ: Ανοιχτός Ενσωματισμένος Πράκτορας με Μοντέλα Μεγάλης Γλώσσας](https://arxiv.org/abs/2305.16291) - Το πρωτότυπο χαρτί.
- [ΕργαλείοFormer](https://arxiv.org/abs/2302.04761) - Διδασκαλία LLMs να χρησιμοποιούν εργαλεία
- [Επανεκκίνηση](https://arxiv.org/abs/2210.03629) - Λογικό + μοτίβο δράσης
- [Δέντρο Σκέψεων](https://arxiv.org/abs/2305.10601) - Επίλεκτη επίλυση προβλημάτων

**Σε αυτό το blog:**

- [Κατασκευή ενός συστήματος ΚΓΠΕ](/blog/rag-primer) - Υβριδική αρχιτεκτονική ανάκτησης + παραγωγής
- [Σημαντική αναζήτηση με ONNX και Qdrant](/blog/semantic-search-with-onnx-and-qdrant) - Ενσωμάτωση χωρίς ακριβά APIs
- [Ο Πόλεμος στο 404](/blog/the-war-on-404) - Tiered approach to link fixing
- [Χρήση της Ollama για τοπικά LLMs](/blog/reanimation) - Αυτοεξυπηρετώντας μικρότερα μοντέλα
- [Κατασκευή μιας σειράς Δικηγόρων GPT](/blog/building-a-lawyer-gpt-for-your-blog-part1) - Σειρά πολλαπλών μερών για τις ΚΓΠΕ + LLMs

**Εργαλεία:**

- [ΟλάμαCity name (optional, probably does not need a translation)](https://ollama.ai/) - Εκτέλεση Llama, Qwen, και άλλα τοπικά μοντέλα
- [LiteLLM](https://github.com/BerriAI/litellm) - Unified API για 100+ παρόχους LLM
- [Λανγκ ΤσέινCity name (optional, probably does not need a translation)](https://www.langchain.com/) - Πλαίσιο για εφαρμογές LLM (αν και τείνω να αποφεύγω τα βαριά πλαίσια)