Τεχνητή Νοημοσύνη (AI). Τι είναι, τι ξέρουμε, τι αλλάζει στη ζωή και στον πολιτισμό;

Και εγένετο Mythos/Fable 5.1


View attachment 276440

Είναι κατά 75% φθηνότερα τα cache reads και είναι εξαιρετικά πιο token efficient σε σχέση με τα Fable/Opus 5.
Οπότε από αύριο τουλάχιστον όλα τα δικά μου workloads πάνε σε αυτό.
Καιρό είχαμε μείνει χωρίς κορυφαίο νέο μοντέλο! Ναι ξεκίνησαν τα optimizations και μπορούν να κόψουν και σε τιμές. Εξάλλου η OpenAI έχει ξεκινήσει πόλεμο τιμών.

Βλέποντας το επίπεδο των open μοντέλων που έρχονται από Κίνα και το πόσο βελτιωμένα είναι πρέπει και οι Αμερικάνοι να επιταγχύνουν τα νέα μοντέλα τους - αν μπορούν βέβαια και με το voluntary internal testing.

Υ.Γ. Το πολύ θετικό είναι ότι βγήκε με τη μία σε όλους και όχι δοκιμαστικές περιόδους κλπ όπως έγινε με την προηγούμενη γενιά.
 
Έχουν αρχίσει να έρχονται τα benchmarks και είναι ξεκάθαρα σημαντικό βήμα εμπρός, είναι με διαφορά το καλύτερο μοντέλο.
1788346706004.png

Από την άλλη βγήκαν τα πρώτα Benchmarks για το κόστος και παρά τα μεγάλα λόγια για μείωση τιμών, στην πράξη φαίνεται ότι είναι ακριβότερο και από το 5.
1788346605099.png
 
Βλέποντας το επίπεδο των open μοντέλων που έρχονται από Κίνα και το πόσο βελτιωμένα είναι πρέπει και οι Αμερικάνοι να επιταγχύνουν τα νέα μοντέλα τους - αν μπορούν βέβαια και με το voluntary internal testing.

Πλέον είναι ξεκάθαρο όμως πως τα μεγάλα τους μοντέλα είναι εκπαιδευμένα μέσω εκείνων των OpenAI & Anthropic. Δεν γίνεται πρωτογενής έρευνα.
Εκεί που είναι καλοί είναι στο packaging. Όντως βγάζουν ωραία μοντέλα σε μικρά μεγέθη.

Από την άλλη βγήκαν τα πρώτα Benchmarks για το κόστος και παρά τα μεγάλα λόγια για μείωση τιμών, στην πράξη φαίνεται ότι είναι ακριβότερο και από το 5.

Φθηνότερο είναι μόνο στον προγραμματισμό που έχει άπειρα cache reads. Αυτό είναι που "φθήνυνε".

Έχουν αρχίσει να έρχονται τα benchmarks και είναι ξεκάθαρα σημαντικό βήμα εμπρός, είναι με διαφορά το καλύτερο μοντέλο.

Το μεγαλύτερο leap έγινε στις λοιπές επιστήμες πάντως. Στο terminal bench science, πήγε από 24,7% στο 52.6%. Εκεί έχει ενδιαφέρον να δούμε τι κάνει.

1788353176430.png
 
Πλέον είναι ξεκάθαρο όμως πως τα μεγάλα τους μοντέλα είναι εκπαιδευμένα μέσω εκείνων των OpenAI & Anthropic. Δεν γίνεται πρωτογενής έρευνα.
Εκεί που είναι καλοί είναι στο packaging. Όντως βγάζουν ωραία μοντέλα σε μικρά μεγέθη.



Φθηνότερο είναι μόνο στον προγραμματισμό που έχει άπειρα cache reads. Αυτό είναι που "φθήνυνε".



Το μεγαλύτερο leap έγινε στις λοιπές επιστήμες πάντως. Στο terminal bench science, πήγε από 24,7% στο 52.6%. Εκεί έχει ενδιαφέρον να δούμε τι κάνει.

View attachment 276460
Θα προσπαθήσω να το τσεκάρω το Claude, γιατί ότι τεστ έχω κάνει μήνες τώρα, πάντα τα μοντέλα της OpenAI έδιναν καλύτερο αποτέλεσμα σε αυτό συγκεκριμένα το πεδίο.

Πάντως η Apple στοχεύει τελείως σε τοπικά μοντέλα. Τα καινούργια της workstation θα έχουν 512 GB ram...με 4 τέτοια τρέχεις σε αργή ταχύτητα τα μεγαλύτερα Κινέζικα μοντέλα.

Από την άλλη μέχρι το τέλος Σεπτέμβρη νομίζω ότι θα έχω έτοιμο το τοπικό σεταπ με το Ryzen AI Max+ 395 + 128 GB RAM. Θα φτιάξω ένα προσωπικό agent. Η αρχιτεκτονική-στόχος είναι ένας local-first, αρθρωτός AI assistant που λειτουργεί σε Windows. Το Qwen3.8-27B εκτελείται τοπικά μέσω LM Studio/llmster, ενώ από πάνω υπάρχει ένα Python/FastAPI + Pydantic AI harness που διαχειρίζεται τα εργαλεία, τα workflows, τα δικαιώματα πρόσβασης και το context. Η επαγγελματική μνήμη και η «επίσημη» κατάσταση του συστήματος αποθηκεύονται ανεξάρτητα σε SQLite και content-addressed storage, και όχι μέσα στο ίδιο το LLM. Ξεχωριστές, ελεγχόμενες υπηρεσίες αναλαμβάνουν το document parsing, την πρόσβαση στο web, τα email/calendar connectors, τη φωνή και την ιδιωτική πρόσβαση από κινητό μέσω Tailscale, ενώ πιο απαιτητικές εργασίες μπορούν προαιρετικά να περνούν στο cloud μέσω ενός απομονωμένου και ελεγχόμενου ChatGPT μέσω του Codex CLI.
Το βασικό πλεονέκτημα είναι η αποσύζευξη των επιμέρους στοιχείων: το LLM, το inference backend, το retrieval engine ή το user interface μπορούν να αντικατασταθούν ή να αναβαθμιστούν χωρίς να χρειάζεται να ξαναστηθούν από την αρχή η μνήμη, οι πολιτικές, τα workflows και οι διασυνδέσεις. Παράλληλα, τα εμπιστευτικά δεδομένα παραμένουν τοπικά, οι κρίσιμες ενέργειες ελέγχονται από deterministic software και όλο το σύστημα παραμένει ελέγξιμο, ανακατασκευάσιμο και σχετικά ανεξάρτητο από συγκεκριμένο vendor ή μοντέλο.
 
Το Fable δεν υπάρχει οικονομικός τρόπος να το δοκιμάσεις πάντως. Claude Max ή Enterprise μόνο.
Αν θέλεις στείλε μου ένα prompt που να είναι περίπλοκο και υπό κανονικές συνθήκες χρειάζεται να βάλεις χέρι μετά ή χρειάζεσαι μπόλικα interactions να δοκιμάσουμε.

Πάντως η Apple στοχεύει τελείως σε τοπικά μοντέλα. Τα καινούργια της workstation θα έχουν 512 GB ram...με 4 τέτοια τρέχεις σε αργή ταχύτητα τα μεγαλύτερα Κινέζικα μοντέλα.

Θεωρητικά λειτουργεί, πρακτικά δεν λειτουργεί.
Το Kimi K3 χωράει σε 2TB VRAM, αλλά σε 4 mac studio τρέχει με 12-14 tokens/s. Για να κάνεις δουλειά χρειάζεται το μοντέλο να κάνει decode τουλάχιστον με 50 token/s.
Οι πολλαπλές thunderbolt δεν επαρκούν για αυτή τη χρήση, το DGX Spark της Nvidia έχει 400Gbps interfaces και πάλι είναι λίγο.
 
Πάντως δε νομιίζω οτι ο junior θα χάσει την δουλειά του και θα αντικατασταθεί απο ai. Απλά αντί να γράφει κώδικα πλεον θα επιβλέπει AI-generated implementation και θα μαθαίνει να κρίνει. Ομοίως mid/senior θα κάνουν level up στα δικά τους πεδία. Ο παραδοσιακός προγραμματιστής "γράφω κώδικα με το χέρι" θα εξελιχθεί σε *engineer . O κώδικας θα ειναι (αν δεν ειναι ήδη) ενα μέσον όχι η ειδικότητα.
 
Πάντως δε νομιίζω οτι ο junior θα χάσει την δουλειά του και θα αντικατασταθεί απο ai. Απλά αντί να γράφει κώδικα πλεον θα επιβλέπει AI-generated implementation και θα μαθαίνει να κρίνει. Ομοίως mid/senior θα κάνουν level up στα δικά τους πεδία. Ο παραδοσιακός προγραμματιστής "γράφω κώδικα με το χέρι" θα εξελιχθεί σε *engineer . O κώδικας θα ειναι (αν δεν ειναι ήδη) ενα μέσον όχι η ειδικότητα.
Σίγουρα δεν μιλάει κανένας για αφανισμό. Απλά σε μια ομάδα με 10 Junior θα μείνουν 2, από 2 mid θα μείνει ένας και βλέπουμε...Σίγουρα ο προγραμματισμός όπως τον ξέραμε έχει πεθάνει και όλοι όπως κάποτε ζητούσαν επάρκεια σε Word / Excel για όλους τους υπαλλήλους τους τώρα θα ζητάνε για AI tools.
 
  • Like
Reactions: Φρα.Πε.
Σίγουρα δεν μιλάει κανένας για αφανισμό. Απλά σε μια ομάδα με 10 Junior θα μείνουν 2, από 2 mid θα μείνει ένας και βλέπουμε...Σίγουρα ο προγραμματισμός όπως τον ξέραμε έχει πεθάνει και όλοι όπως κάποτε ζητούσαν επάρκεια σε Word / Excel για όλους τους υπαλλήλους τους τώρα θα ζητάνε για AI tools.
Παλι 10 junior θα ειναι αλλα αντι να εχουν 10 εργα, θα εχουν 20. Αν θελουν παλι 10 εργα τοτε ναι, συμφωνω μαζι σου θα γινουν 2.
 
Το Fable δεν υπάρχει οικονομικός τρόπος να το δοκιμάσεις πάντως. Claude Max ή Enterprise μόνο.
Αν θέλεις στείλε μου ένα prompt που να είναι περίπλοκο και υπό κανονικές συνθήκες χρειάζεται να βάλεις χέρι μετά ή χρειάζεσαι μπόλικα interactions να δοκιμάσουμε.



Θεωρητικά λειτουργεί, πρακτικά δεν λειτουργεί.
Το Kimi K3 χωράει σε 2TB VRAM, αλλά σε 4 mac studio τρέχει με 12-14 tokens/s. Για να κάνεις δουλειά χρειάζεται το μοντέλο να κάνει decode τουλάχιστον με 50 token/s.
Οι πολλαπλές thunderbolt δεν επαρκούν για αυτή τη χρήση, το DGX Spark της Nvidia έχει 400Gbps interfaces και πάλι είναι λίγο.
Εγώ βλέπω τα πιο κάτω και είμαι αισιόδοξος ότι υπάρχει ακόμη τεράστιος χώρος για βελτιστοποίηση του κώδικα των LLM...
To ταπεινό Qwen3.8 με μόλις 27Β παραμέτρους είναι καλύτερο από τεράστια μοντέλα σαν το Sonnet 4.6 ή το ChatGPT 5.3 και οριακά χειρότερο από το ChatGPT 5.4. Μην ξεχνάμε ότι το 5.4 το χρησιμοποιούσαμε σαν κορυφαίο μοντέλο τον Απρίλιο του 2026, μόλις 4 μήνες πριν...

Σε κάθε περίπτωση για τα δύσκολα / μεγάλα task θα πηγαίνεις στο καλύτερο διαθέσιμο frontier μοντέλο, δεν λέει κανείς το αντίθετο. Αλλά υπάρχουν και task που απλά δεν χρειάζεται αυτό. Θα το δω και προσωπικά στη χρήση που θα κάνω. Έτσι και αλλιώς μέσω CODEX CLI σε extra high, είναι πρακτικά απεριόριστο, οπότε μπορώ εύκολα να κάνω routing από τον local agent προς τα εκεί. To local LLM είναι αρκετό για να φτιάχνει prompts από λίγα δικά μου λόγια (ελπίζω) και να κάνει όλα τα υπόλοιπα τασκ γραφείου καθημερινά. Να πω την αλήθεια ένας από τους λόγους για Local είναι να αρχίζω να μαζεύω μνήμες από το πως εργάζομαι για να μπορέσω να τις αξιοποιήσω σε εκπαίδευση μελλοντικών agents. Έχω απενεργοποιημένες τις μνήμες σε όλα τα εξωτερικά μοντέλα που χρησιμοποιώ έτσι και αλλιώς.

1788361299809.png
 
Και το Muse 1.3 της Meta σήμερα.
Αυτοί έχουν μια έκδοση που λέγεται contributor, που κρατάνε τα prompts για εκπαίδευση των μοντέλων που το δίνει πρακτικά δωρεάν, με αμελητέο κόστος. Εάν κανείς θέλει να παίξει μαζί του σε μη παραγωγικά projects δεν βλέπω γιατί να μην το χρησιμοποιήσει καθ' αυτόν τον τρόπο.

1788380314735.png
 
Παλι 10 junior θα ειναι αλλα αντι να εχουν 10 εργα, θα εχουν 20. Αν θελουν παλι 10 εργα τοτε ναι, συμφωνω μαζι σου θα γινουν 2.
Αυτή είναι ουσιαστικά η γραμμή του Παγκόσμιου Οικονομικού Φόρουμ. Πέρισυ στο report του για το μέλλον της αγοράς εργασίας είπε ότι αναμένεται να έχουμε 170 εκατομύρια νέες θέσεις εργασίας μέχρι το 2030, ενώ θα χαθούν 92 εκατομύρια υπάρχουσες θέσεις εργασίας. Άρα προβλέπουν ότι 78 εκατομύρια άνθρωποι θα βρουν δουλειά από την ανεργία (ή νέοι εργαζόμενοι). Βέβαια γράφουν ότι χρειάζεται τρελό upskilling του εργατικού δυναμικού για να καλυφθούν οι απαιτήσεις αυτών των νέων θέσεων.
Τη λογική του να κυνηγάς πολύ περισσότερα στον ίδιο χρόνο τη βλέπω και εγώ ήδη. Το πρόβλημα είναι ότι αρκετοί κλάδοι είναι πεπερασμένοι και δεν μπορούν να φτιάξουν/υποστηρίξουν νέα έργα από το πουθενά, ειδικά σε περιβάλλον παγκόσμιας οικονομικής ύφεσης.
Θα δείξει...
 
Και το Muse 1.3 της Meta σήμερα.
Αυτοί έχουν μια έκδοση που λέγεται contributor, που κρατάνε τα prompts για εκπαίδευση των μοντέλων που το δίνει πρακτικά δωρεάν, με αμελητέο κόστος. Εάν κανείς θέλει να παίξει μαζί του σε μη παραγωγικά projects δεν βλέπω γιατί να μην το χρησιμοποιήσει καθ' αυτόν τον τρόπο.

View attachment 276484
Γίνεται ένας χαμός από νέα μοντέλα και σε 10 μέρες περιμένουμε το Astra της OpenAI που με κλασσικές μεθόδους marketing έκανε διαρροές σήμερα που τα νέα ασχολιούνταν με την Anthropic.
 
Μακάρι να είναι καλό και να υπάρχουν εναλλακτικές στην αγορά.
Είναι εξαιρετικά δύσκολο προφανώς, αλλά στην αιχμή χρειαζόμαστε τουλάχιστον 3 για να υπάρχει ανταγωνισμός.

Για το marketing -το αγαπημένο μου, οι AI Influencers που τα αναπαράγουν είναι στη καλύτερη, κωμωδία.
Άνθρωποι που δεν ξέρουν τι τους γίνεται, σχολιάζουν το κάθε μοντέλο βάσει κάποιων τέστ τα οποία είναι πάντα one-shot, πόσο καλά ένα μοντέλο θα φτιάξει ένα browser ένα παιχνίδι και λοιπά άχρηστα prompts που δεν χρησιμοποιεί ποτέ και κανένας.

Λίγοι είναι οι σοβαροί άνθρωποι που κάνουν αντίστοιχα σοβαρή χρήση και το μοιράζονται. Ο πιο ακριβής τρόπος βέβαια με μια χρονοκαθυστέρηση τριμήνου περίπου, για το τι κάνει ο καθένας είναι να δείς τα οικονομικά αποτελέσματα.



Στη δική μου χρήση, εφόσον το νέο Fable είναι όντως αρκετά κοντά στο Opus 5 σε κόστος όσον αφορά το software engineering, ότι χρειάζομαι πλέον από σήμερα το κάνει αυτό. Να είμαι ειλικρινής, εάν εξαιρέσουμε τον τρόπο γραφής του, στη διάδραση μαζί μου που είναι σαφώς καλύτερο από το προηγούμενο, για ότι εγώ κάνω, δεν υπήρξε task που το Fable 5 δεν έβγαζε και το έβγαλε το 5.1.

Πέραν του software engineering, τα μοντέλα που πληρώνουμε και τα χρησιμοποιούμε σε εφαρμογές παραγωγικά είναι τα flash και flash-light της Google, είναι μετά διαφοράς τα καλύτερα σε latency-κόστος-ευφυία-διαθεσιμότητα, για τη δική μας χρήση και για όταν χρειάζεται να δημιουργήσεις κείμενο, το Opus 4.6 που έχει έναν εξαιρετικά ζεστό τρόπο γραφής. Δοκιμάσαμε το luna αλλά τρέχει στο 1/5 της ταχύτητας του Gemini 3.5 flash-lite.

Το καλό τόσο με το Vertex του GCP όσο και με το Bedrock στην AWS είναι πως έχεις πρόσβαση σε όποιο μοντέλο θέλεις ενώ μπορείς να επιλέξεις και Ευρωπαϊκό region για το inference εάν υπάρχει αυτή η απαίτηση στην εφαρμογή.
 
Έχεις απόλυτο δίκαιο. Ο ανταγωνισμός σίγουρα μας πάει μπροστά. Σήμερα έχουμε:
Closed:
- Anthropic Fable 5.1
- OpenAI ChatGPT 5.6 Sol
- xAI Grok 4.6
- Google Gemini 3.8 Flash
- Meta Muse Spark 1.3

Open (γράφω τα κορυφαία όχι όλα που θέλουν cloud):
- Kimi K3
- GLM 5.3
- Qwen3.8 2.4T A95B
- Deepseek v4 Pro
- Minimax M3

Και αυτά που μπορούμε να τρέξουμε σπίτι (ok με 5-10-15000 ευρώ, αλλά και πάλι):
- Qwen3.8 27B
- Gemma 4 31B
- MiniMax-M3
- GLM 5.3 Flash
- Nemotron 3 Nano Omni
- Inkling

Το να έχεις 5+ μοντέλα σε κάθε κατηγορία που σχεδόν όλα είναι καλύτερα από το frontier 6 μήνες πριν είναι απλά απίστευτο...

Και ναι προφανώς υπάρχει cross-fertilization.
Οι closed βλέπουν τις open εταιρίες που έχουν πραγματικά πιστεύω edge στο optimization σε σχέση με περιορισμένες υπολογιστικές υποδομές και οι open κάνουν -πια- περιορισμένο distillation. Για εμένα και τα 2 θεμιτά είναι.
 
  • Like
Reactions: anderm
Και GPT-6 Astra στην αγορά.
Επειδή εδώ είναι μεγαλύτερο launch, μοντέλο αντίστοιχο του Fable σε μέγεθος πιθανώς οπότε και τιμολογείται το ίδιο, θα τα βάλω όλα.
Είναι εξαιρετικά efficient μοντέλο, παρότι έχει την ίδια ονομαστική τιμή, το κόστος ανά task είναι το μισό του Fable 5.1

Τα σχόλια του Artificial Analysis για το σύνολο των Benchmarks:

GPT-6 Astra makes significant gains in the Artificial Analysis Coding Agent Index, scoring equal to Fable 5 at lower cost. In the Intelligence Index, it uses fewer tokens than GPT-5.6 Sol for similar performance, but this is outweighed by higher prices
Pricing is 2.5x GPT-5.6 Sol’s current prices across the board, up from $4/$20 to $10/$50 per million input/output tokens, with the same 90% discount for cache reads and 25% premium for cache writes.We see distinct stories across our two flagship Indices. In the Artificial Analysis Coding Agent Index, GPT-6 Astra equals Fable 5 at less than half the cost, driven by significant token efficiency gains. In the Artificial Analysis Intelligence Index, GPT-6 Astra is more token efficient than its predecessor for similar performance, but this is offset by the price increase.Artificial Analysis Coding Agent Index - key takeaways:
➤ Rivals top models: In Codex, GPT-6 Astra scores 67 in the Index - approximately equal to Claude Opus 5 and Fable 5 in Claude Code, and Muse Spark 1.3 in Muse Code. Fable 5.1 in Claude Code leads the Index with a score of 70.
➤ 70% more token efficient than GPT-5.6 Sol: GPT-6 Astra sees a substantial improvement in token efficiency, using one third of the tokens compared to GPT-5.6 Sol (max) in the Codex harness, and one fifth of the tokens of Claude Opus 5 (xhigh). Various effort levels of the model occupy the Pareto frontier of token efficiency.➤ Leads Coding Agent Index cost efficiency frontier: At max effort, GPT-6 Astra costs about the same as GPT-5.6 Sol (max) while scoring 2 points higher on the Index. Per task, the model is less than half the cost of Claude Fable 5, for the same score.Artificial Analysis Intelligence Index - key takeaways:
➤ Sits beside GPT-5.6 Sol in Intelligence: GPT-6 Astra scores equal to GPT-5.6 Sol in the Index at 61. This is 5 points lower than Claude Fable 5.1 (max with fallback). The model also trails Meta’s newly released Muse Spark 1.3 (max).
➤ ~10% fewer output tokens, offset by price increase: GPT-6 Astra defines a new Pareto frontier for Intelligence Index vs Output Tokens per Task - with a ~10% reduction in token use at max effort compared to GPT-5.6 Sol. However, due to the 2.5x increase in price, the model is 75% more expensive per task than its predecessor at max effort.
➤ Hallucinates half as much as GPT-5.6 Sol: GPT-6 Astra sees a large jump in AA-Omniscience, our knowledge and hallucination benchmark. This is driven by a significant decrease in hallucination rate from 92% to 51% at max effort. Unlike some models, this improvement does not come at the cost of accuracy - Astra increased accuracy by 4 points at the same time.
➤ ~80 point gain in AA-Briefcase Elo: GPT-6 Astra improves ~80 points in AA-Briefcase, our frontier long-horizon knowledge work evaluation. Models are tested on multi-week projects, with many linked tasks and thousands of source files. Astra sees a significant increase in both rubric scores and Analytical Quality Elo in AA-Briefcase compared to its predecessor. In the other direction, we observe a reduction in Presentation Quality Elo, where GPT-5.6 Sol (max) still leads all models.
➤ Mixed progress on other evaluations: The model sees a 6 point gain in Humanity’s Last Exam, a long-standing evaluation with emphasis on mathematics, science, and humanities. This is offset by a drop of ~80 Elo points in GDPval-AA v2 - a benchmark we adapted from OpenAI’s dataset measuring economically valuable tasks across 44 occupations. We also observe 2-3 point regressions on other evaluations across a mix of capabilities, including reductions in τ³-Banking (customer support), SciCode (Python problems in a scientific domain), and AA-LCR (long context reasoning over large documents).

1788465729374.png

1788465812490.png

1788465846621.png

1788466008925.png
 
Είναι ξεκάθαρα νέο unoptimized μοντέλο και έχει τις παιδικές ασθένειες που είχε το Fable 5, όπως και κάθε πρώτο μοντέλο νέας γενιάς. Στην πράξη να το δούμε. Πάντως είναι η πρώτη φορά που δεν πιάνει την Anthropic στα benchmarks. Προσπαθώντας να ξεχωρίσω τα πραγματικά νέα από το hype μάλλον 3 πράγματα ισχύουν (θα τα δω στην πράξη όταν το ενεργοποιήσουν σε όλους).
1. To computer use αρχίζει να προμοτάρεται σοβαρά και το μοντέλο που στην ουσία κουβαλάει πια ώριμο harness μπορεί να χρησιμοποιεί εξωτερικά λογισμικά με ευκολία.
2. Μειώνεται η ανάγκη για αναλυτικά prompt. Ζητάς το τελικό αποτέλεσμα και δεν ασχολείσαι με ενδιάμεσα στάδια, το αφήνεις σε αυτό και κρίνεις το αποτέλεσμα. Και δεν μιλάμε για προγραμματισμό εδώ, αλλά για κανονικά task που δεν έχουν άμεση σχέση με software development.
3. Αυτό που έχει κάνει τους doom's dayers να λένε ότι είμαστε πιο κοντά στον αφανισμό είναι η μετάβαση στο recurrent depth / Looped transformers. Η πιο απλή περιγραφή που διάβασα είναι ότι ένας παραδοσιακός transformer εξάγει την επόμενη νέα λέξη μετά από επεξεργασία των προηγούμενων λέξεων για ένα προκαθορισμένο σταθερό αριθμό βημάτων. Στο recurrent depth το μοντέλο εξάγει μια νέα λέξη μετά από επεξεργασία των προηγούμενων λέξεων μέσα από κάποια Layers μεταβλητό αριθμό φορών. Δείτε και το διάγραμμα. Αυτό ισχυρίζονται αρκετοί ότι είναι ουσιαστικά το άνοιγμα της πόρτας του AGI. Οι συνομοσιολόγοι λένε ότι το recurrent block είναι το πρώτο κομμάτι που δεν θα ξέρουμε ακριβώς τι κάνει και δεν θα μπορούμε να το περιγράψουμε με γλωσσικούς όρους. Δηλαδή μια γλώσσα μηχανής που δεν θα έχουμε όμως διαμορφώσει εμείς.

Πάντως ξέρουμε ήδη ότι όσο πιο μακριά από ανθρώπινη γλώσσα είναι η έκφραση της σκέψης των μοντέλων, τόσο αυξάνει η αποδοτικότητά τους.

Το πόσο είναι hype και πόσο είναι πραγματικότητα θα το δούμε τις επόμενες ημέρες.



1788468323896.png

Αν κάποιος θέλει να μάθει περισσότερα:
 
State of the Art είναι και αυτό.
Φαίνεται στα επιμέρους, πχ στο omniscience.

Γενικά, πλέον είναι εξαιρετικά δύσκολο να γραφτούν benchmarks για τα νεότερα μοντέλα.
Το DeepSWE, που θεωρητικά ήταν το "αξιόπιστο" στο software development, έβγαλε εχθές πρώτο το Gemini 3.8 Flash. Καλό μοντελάκι για το μέγεθος του αλλά είναι αστείο και να το συζητάμε.

1788473275356.png

Το Terminal Bench 4, το τοποθετεί στο ίδιο σκόρ με το Fable 5.1 αλλά με ίδια απόδοση (υπάρχει εύρος εμπιστοσύνης) μεταξύ medium και max thinking level.
Που σε πραγματική χρήση, το thinking level παίζει ρόλο στο πόσο προσπαθεί να λύσει ένα πρόβλημα το μοντέλο. Για να αποδίδει το ίδιο ανεξαρτήτως thinking level δύο είναι τα τινά, είτε στα weights του υπάρχουν τα μοτίβα του εκάστοτε τέστ, όπως παραδέχθηκε η spacex για τον Grok στο cursor-bench, είτε το τέστ δεν αξιολογεί το μοντέλο όπως πρέπει.

1788473348329.png
 
Γενικώς όσο βγαίνουν τα benchmark νομίζω όντως Αντρέα ότι θέλουμε νέα bencmarks. Το ARC-AGI-3 τερματίστηκε, όπως και το FrontierMath Tier 4 (v2).
Έμεινα με το στόμα ανοικτό με το Terminal-Bench Science 0.1 με 64.6%, ενώ το Fable 5.1 είναι στο 52.6% και η αύξηση σε σχέση με το 22.4% του Sol είναι τεράστια.
Επίσης βλέπω πολύ μεγάλη βελτίωση στην αντίληψη τρισδιάστατου κόσμου. Ίσως πλησιάζουμε σε κάποιο πρώτο world model. Το BenchCAD στο 95.9% είναι απίστευτο.
To DeepSWE v1.1. που πολλοί λένε ότι είναι το καλύτερο στο να μεταφέρει την αίσθηση που δίνει ένα μοντέλο στο χρήστη έφτασε στο 74.1% σε σύγκριση με το 67.4% του Fable 5.1.
Τέλος λέει η OpenAI ότι είναι fully aligned το μοντέλο. Θα το δούμε αυτό.

Νιώθω ότι σε πολύ λίγο καιρό δεν θα έχουμε την δυνατότητα σαν άνθρωποι να αντιληφθούμε τις διαφορές των μοντέλων...εκτός φυσικά από τα benchmarks του κόστους.

1788500004623.png


1788500135891.png
 

Attachments

  • 1788500178588.png
    1788500178588.png
    57.5 KB · Views: 0