Τεχνητή Νοημοσύνη (AI). Τι είναι, τι ξέρουμε, τι αλλάζει στη ζωή και στον πολιτισμό;

Και εγένετο Mythos/Fable 5.1


View attachment 276440

Είναι κατά 75% φθηνότερα τα cache reads και είναι εξαιρετικά πιο token efficient σε σχέση με τα Fable/Opus 5.
Οπότε από αύριο τουλάχιστον όλα τα δικά μου workloads πάνε σε αυτό.
Καιρό είχαμε μείνει χωρίς κορυφαίο νέο μοντέλο! Ναι ξεκίνησαν τα optimizations και μπορούν να κόψουν και σε τιμές. Εξάλλου η OpenAI έχει ξεκινήσει πόλεμο τιμών.

Βλέποντας το επίπεδο των open μοντέλων που έρχονται από Κίνα και το πόσο βελτιωμένα είναι πρέπει και οι Αμερικάνοι να επιταγχύνουν τα νέα μοντέλα τους - αν μπορούν βέβαια και με το voluntary internal testing.

Υ.Γ. Το πολύ θετικό είναι ότι βγήκε με τη μία σε όλους και όχι δοκιμαστικές περιόδους κλπ όπως έγινε με την προηγούμενη γενιά.
 
Έχουν αρχίσει να έρχονται τα benchmarks και είναι ξεκάθαρα σημαντικό βήμα εμπρός, είναι με διαφορά το καλύτερο μοντέλο.
1788346706004.png

Από την άλλη βγήκαν τα πρώτα Benchmarks για το κόστος και παρά τα μεγάλα λόγια για μείωση τιμών, στην πράξη φαίνεται ότι είναι ακριβότερο και από το 5.
1788346605099.png
 
Βλέποντας το επίπεδο των open μοντέλων που έρχονται από Κίνα και το πόσο βελτιωμένα είναι πρέπει και οι Αμερικάνοι να επιταγχύνουν τα νέα μοντέλα τους - αν μπορούν βέβαια και με το voluntary internal testing.

Πλέον είναι ξεκάθαρο όμως πως τα μεγάλα τους μοντέλα είναι εκπαιδευμένα μέσω εκείνων των OpenAI & Anthropic. Δεν γίνεται πρωτογενής έρευνα.
Εκεί που είναι καλοί είναι στο packaging. Όντως βγάζουν ωραία μοντέλα σε μικρά μεγέθη.

Από την άλλη βγήκαν τα πρώτα Benchmarks για το κόστος και παρά τα μεγάλα λόγια για μείωση τιμών, στην πράξη φαίνεται ότι είναι ακριβότερο και από το 5.

Φθηνότερο είναι μόνο στον προγραμματισμό που έχει άπειρα cache reads. Αυτό είναι που "φθήνυνε".

Έχουν αρχίσει να έρχονται τα benchmarks και είναι ξεκάθαρα σημαντικό βήμα εμπρός, είναι με διαφορά το καλύτερο μοντέλο.

Το μεγαλύτερο leap έγινε στις λοιπές επιστήμες πάντως. Στο terminal bench science, πήγε από 24,7% στο 52.6%. Εκεί έχει ενδιαφέρον να δούμε τι κάνει.

1788353176430.png
 
Πλέον είναι ξεκάθαρο όμως πως τα μεγάλα τους μοντέλα είναι εκπαιδευμένα μέσω εκείνων των OpenAI & Anthropic. Δεν γίνεται πρωτογενής έρευνα.
Εκεί που είναι καλοί είναι στο packaging. Όντως βγάζουν ωραία μοντέλα σε μικρά μεγέθη.



Φθηνότερο είναι μόνο στον προγραμματισμό που έχει άπειρα cache reads. Αυτό είναι που "φθήνυνε".



Το μεγαλύτερο leap έγινε στις λοιπές επιστήμες πάντως. Στο terminal bench science, πήγε από 24,7% στο 52.6%. Εκεί έχει ενδιαφέρον να δούμε τι κάνει.

View attachment 276460
Θα προσπαθήσω να το τσεκάρω το Claude, γιατί ότι τεστ έχω κάνει μήνες τώρα, πάντα τα μοντέλα της OpenAI έδιναν καλύτερο αποτέλεσμα σε αυτό συγκεκριμένα το πεδίο.

Πάντως η Apple στοχεύει τελείως σε τοπικά μοντέλα. Τα καινούργια της workstation θα έχουν 512 GB ram...με 4 τέτοια τρέχεις σε αργή ταχύτητα τα μεγαλύτερα Κινέζικα μοντέλα.

Από την άλλη μέχρι το τέλος Σεπτέμβρη νομίζω ότι θα έχω έτοιμο το τοπικό σεταπ με το Ryzen AI Max+ 395 + 128 GB RAM. Θα φτιάξω ένα προσωπικό agent. Η αρχιτεκτονική-στόχος είναι ένας local-first, αρθρωτός AI assistant που λειτουργεί σε Windows. Το Qwen3.8-27B εκτελείται τοπικά μέσω LM Studio/llmster, ενώ από πάνω υπάρχει ένα Python/FastAPI + Pydantic AI harness που διαχειρίζεται τα εργαλεία, τα workflows, τα δικαιώματα πρόσβασης και το context. Η επαγγελματική μνήμη και η «επίσημη» κατάσταση του συστήματος αποθηκεύονται ανεξάρτητα σε SQLite και content-addressed storage, και όχι μέσα στο ίδιο το LLM. Ξεχωριστές, ελεγχόμενες υπηρεσίες αναλαμβάνουν το document parsing, την πρόσβαση στο web, τα email/calendar connectors, τη φωνή και την ιδιωτική πρόσβαση από κινητό μέσω Tailscale, ενώ πιο απαιτητικές εργασίες μπορούν προαιρετικά να περνούν στο cloud μέσω ενός απομονωμένου και ελεγχόμενου ChatGPT μέσω του Codex CLI.
Το βασικό πλεονέκτημα είναι η αποσύζευξη των επιμέρους στοιχείων: το LLM, το inference backend, το retrieval engine ή το user interface μπορούν να αντικατασταθούν ή να αναβαθμιστούν χωρίς να χρειάζεται να ξαναστηθούν από την αρχή η μνήμη, οι πολιτικές, τα workflows και οι διασυνδέσεις. Παράλληλα, τα εμπιστευτικά δεδομένα παραμένουν τοπικά, οι κρίσιμες ενέργειες ελέγχονται από deterministic software και όλο το σύστημα παραμένει ελέγξιμο, ανακατασκευάσιμο και σχετικά ανεξάρτητο από συγκεκριμένο vendor ή μοντέλο.
 
Το Fable δεν υπάρχει οικονομικός τρόπος να το δοκιμάσεις πάντως. Claude Max ή Enterprise μόνο.
Αν θέλεις στείλε μου ένα prompt που να είναι περίπλοκο και υπό κανονικές συνθήκες χρειάζεται να βάλεις χέρι μετά ή χρειάζεσαι μπόλικα interactions να δοκιμάσουμε.

Πάντως η Apple στοχεύει τελείως σε τοπικά μοντέλα. Τα καινούργια της workstation θα έχουν 512 GB ram...με 4 τέτοια τρέχεις σε αργή ταχύτητα τα μεγαλύτερα Κινέζικα μοντέλα.

Θεωρητικά λειτουργεί, πρακτικά δεν λειτουργεί.
Το Kimi K3 χωράει σε 2TB VRAM, αλλά σε 4 mac studio τρέχει με 12-14 tokens/s. Για να κάνεις δουλειά χρειάζεται το μοντέλο να κάνει decode τουλάχιστον με 50 token/s.
Οι πολλαπλές thunderbolt δεν επαρκούν για αυτή τη χρήση, το DGX Spark της Nvidia έχει 400Gbps interfaces και πάλι είναι λίγο.
 
Πάντως δε νομιίζω οτι ο junior θα χάσει την δουλειά του και θα αντικατασταθεί απο ai. Απλά αντί να γράφει κώδικα πλεον θα επιβλέπει AI-generated implementation και θα μαθαίνει να κρίνει. Ομοίως mid/senior θα κάνουν level up στα δικά τους πεδία. Ο παραδοσιακός προγραμματιστής "γράφω κώδικα με το χέρι" θα εξελιχθεί σε *engineer . O κώδικας θα ειναι (αν δεν ειναι ήδη) ενα μέσον όχι η ειδικότητα.
 
Πάντως δε νομιίζω οτι ο junior θα χάσει την δουλειά του και θα αντικατασταθεί απο ai. Απλά αντί να γράφει κώδικα πλεον θα επιβλέπει AI-generated implementation και θα μαθαίνει να κρίνει. Ομοίως mid/senior θα κάνουν level up στα δικά τους πεδία. Ο παραδοσιακός προγραμματιστής "γράφω κώδικα με το χέρι" θα εξελιχθεί σε *engineer . O κώδικας θα ειναι (αν δεν ειναι ήδη) ενα μέσον όχι η ειδικότητα.
Σίγουρα δεν μιλάει κανένας για αφανισμό. Απλά σε μια ομάδα με 10 Junior θα μείνουν 2, από 2 mid θα μείνει ένας και βλέπουμε...Σίγουρα ο προγραμματισμός όπως τον ξέραμε έχει πεθάνει και όλοι όπως κάποτε ζητούσαν επάρκεια σε Word / Excel για όλους τους υπαλλήλους τους τώρα θα ζητάνε για AI tools.
 
  • Like
Reactions: Φρα.Πε.
Σίγουρα δεν μιλάει κανένας για αφανισμό. Απλά σε μια ομάδα με 10 Junior θα μείνουν 2, από 2 mid θα μείνει ένας και βλέπουμε...Σίγουρα ο προγραμματισμός όπως τον ξέραμε έχει πεθάνει και όλοι όπως κάποτε ζητούσαν επάρκεια σε Word / Excel για όλους τους υπαλλήλους τους τώρα θα ζητάνε για AI tools.
Παλι 10 junior θα ειναι αλλα αντι να εχουν 10 εργα, θα εχουν 20. Αν θελουν παλι 10 εργα τοτε ναι, συμφωνω μαζι σου θα γινουν 2.
 
Το Fable δεν υπάρχει οικονομικός τρόπος να το δοκιμάσεις πάντως. Claude Max ή Enterprise μόνο.
Αν θέλεις στείλε μου ένα prompt που να είναι περίπλοκο και υπό κανονικές συνθήκες χρειάζεται να βάλεις χέρι μετά ή χρειάζεσαι μπόλικα interactions να δοκιμάσουμε.



Θεωρητικά λειτουργεί, πρακτικά δεν λειτουργεί.
Το Kimi K3 χωράει σε 2TB VRAM, αλλά σε 4 mac studio τρέχει με 12-14 tokens/s. Για να κάνεις δουλειά χρειάζεται το μοντέλο να κάνει decode τουλάχιστον με 50 token/s.
Οι πολλαπλές thunderbolt δεν επαρκούν για αυτή τη χρήση, το DGX Spark της Nvidia έχει 400Gbps interfaces και πάλι είναι λίγο.
Εγώ βλέπω τα πιο κάτω και είμαι αισιόδοξος ότι υπάρχει ακόμη τεράστιος χώρος για βελτιστοποίηση του κώδικα των LLM...
To ταπεινό Qwen3.8 με μόλις 27Β παραμέτρους είναι καλύτερο από τεράστια μοντέλα σαν το Sonnet 4.6 ή το ChatGPT 5.3 και οριακά χειρότερο από το ChatGPT 5.4. Μην ξεχνάμε ότι το 5.4 το χρησιμοποιούσαμε σαν κορυφαίο μοντέλο τον Απρίλιο του 2026, μόλις 4 μήνες πριν...

Σε κάθε περίπτωση για τα δύσκολα / μεγάλα task θα πηγαίνεις στο καλύτερο διαθέσιμο frontier μοντέλο, δεν λέει κανείς το αντίθετο. Αλλά υπάρχουν και task που απλά δεν χρειάζεται αυτό. Θα το δω και προσωπικά στη χρήση που θα κάνω. Έτσι και αλλιώς μέσω CODEX CLI σε extra high, είναι πρακτικά απεριόριστο, οπότε μπορώ εύκολα να κάνω routing από τον local agent προς τα εκεί. To local LLM είναι αρκετό για να φτιάχνει prompts από λίγα δικά μου λόγια (ελπίζω) και να κάνει όλα τα υπόλοιπα τασκ γραφείου καθημερινά. Να πω την αλήθεια ένας από τους λόγους για Local είναι να αρχίζω να μαζεύω μνήμες από το πως εργάζομαι για να μπορέσω να τις αξιοποιήσω σε εκπαίδευση μελλοντικών agents. Έχω απενεργοποιημένες τις μνήμες σε όλα τα εξωτερικά μοντέλα που χρησιμοποιώ έτσι και αλλιώς.

1788361299809.png
 
Και το Muse 1.3 της Meta σήμερα.
Αυτοί έχουν μια έκδοση που λέγεται contributor, που κρατάνε τα prompts για εκπαίδευση των μοντέλων που το δίνει πρακτικά δωρεάν, με αμελητέο κόστος. Εάν κανείς θέλει να παίξει μαζί του σε μη παραγωγικά projects δεν βλέπω γιατί να μην το χρησιμοποιήσει καθ' αυτόν τον τρόπο.

1788380314735.png
 
Παλι 10 junior θα ειναι αλλα αντι να εχουν 10 εργα, θα εχουν 20. Αν θελουν παλι 10 εργα τοτε ναι, συμφωνω μαζι σου θα γινουν 2.
Αυτή είναι ουσιαστικά η γραμμή του Παγκόσμιου Οικονομικού Φόρουμ. Πέρισυ στο report του για το μέλλον της αγοράς εργασίας είπε ότι αναμένεται να έχουμε 170 εκατομύρια νέες θέσεις εργασίας μέχρι το 2030, ενώ θα χαθούν 92 εκατομύρια υπάρχουσες θέσεις εργασίας. Άρα προβλέπουν ότι 78 εκατομύρια άνθρωποι θα βρουν δουλειά από την ανεργία (ή νέοι εργαζόμενοι). Βέβαια γράφουν ότι χρειάζεται τρελό upskilling του εργατικού δυναμικού για να καλυφθούν οι απαιτήσεις αυτών των νέων θέσεων.
Τη λογική του να κυνηγάς πολύ περισσότερα στον ίδιο χρόνο τη βλέπω και εγώ ήδη. Το πρόβλημα είναι ότι αρκετοί κλάδοι είναι πεπερασμένοι και δεν μπορούν να φτιάξουν/υποστηρίξουν νέα έργα από το πουθενά, ειδικά σε περιβάλλον παγκόσμιας οικονομικής ύφεσης.
Θα δείξει...
 
Και το Muse 1.3 της Meta σήμερα.
Αυτοί έχουν μια έκδοση που λέγεται contributor, που κρατάνε τα prompts για εκπαίδευση των μοντέλων που το δίνει πρακτικά δωρεάν, με αμελητέο κόστος. Εάν κανείς θέλει να παίξει μαζί του σε μη παραγωγικά projects δεν βλέπω γιατί να μην το χρησιμοποιήσει καθ' αυτόν τον τρόπο.

View attachment 276484
Γίνεται ένας χαμός από νέα μοντέλα και σε 10 μέρες περιμένουμε το Astra της OpenAI που με κλασσικές μεθόδους marketing έκανε διαρροές σήμερα που τα νέα ασχολιούνταν με την Anthropic.
 
Μακάρι να είναι καλό και να υπάρχουν εναλλακτικές στην αγορά.
Είναι εξαιρετικά δύσκολο προφανώς, αλλά στην αιχμή χρειαζόμαστε τουλάχιστον 3 για να υπάρχει ανταγωνισμός.

Για το marketing -το αγαπημένο μου, οι AI Influencers που τα αναπαράγουν είναι στη καλύτερη, κωμωδία.
Άνθρωποι που δεν ξέρουν τι τους γίνεται, σχολιάζουν το κάθε μοντέλο βάσει κάποιων τέστ τα οποία είναι πάντα one-shot, πόσο καλά ένα μοντέλο θα φτιάξει ένα browser ένα παιχνίδι και λοιπά άχρηστα prompts που δεν χρησιμοποιεί ποτέ και κανένας.

Λίγοι είναι οι σοβαροί άνθρωποι που κάνουν αντίστοιχα σοβαρή χρήση και το μοιράζονται. Ο πιο ακριβής τρόπος βέβαια με μια χρονοκαθυστέρηση τριμήνου περίπου, για το τι κάνει ο καθένας είναι να δείς τα οικονομικά αποτελέσματα.



Στη δική μου χρήση, εφόσον το νέο Fable είναι όντως αρκετά κοντά στο Opus 5 σε κόστος όσον αφορά το software engineering, ότι χρειάζομαι πλέον από σήμερα το κάνει αυτό. Να είμαι ειλικρινής, εάν εξαιρέσουμε τον τρόπο γραφής του, στη διάδραση μαζί μου που είναι σαφώς καλύτερο από το προηγούμενο, για ότι εγώ κάνω, δεν υπήρξε task που το Fable 5 δεν έβγαζε και το έβγαλε το 5.1.

Πέραν του software engineering, τα μοντέλα που πληρώνουμε και τα χρησιμοποιούμε σε εφαρμογές παραγωγικά είναι τα flash και flash-light της Google, είναι μετά διαφοράς τα καλύτερα σε latency-κόστος-ευφυία-διαθεσιμότητα, για τη δική μας χρήση και για όταν χρειάζεται να δημιουργήσεις κείμενο, το Opus 4.6 που έχει έναν εξαιρετικά ζεστό τρόπο γραφής. Δοκιμάσαμε το luna αλλά τρέχει στο 1/5 της ταχύτητας του Gemini 3.5 flash-lite.

Το καλό τόσο με το Vertex του GCP όσο και με το Bedrock στην AWS είναι πως έχεις πρόσβαση σε όποιο μοντέλο θέλεις ενώ μπορείς να επιλέξεις και Ευρωπαϊκό region για το inference εάν υπάρχει αυτή η απαίτηση στην εφαρμογή.