Τεχνητή Νοημοσύνη (AI). Τι είναι, τι ξέρουμε, τι αλλάζει στη ζωή και στον πολιτισμό;

  • Αγαπητοί φίλοι και φίλες,

    Σας προσκαλούμε να γιορτάσουμε μαζί τα 20α γενέθλια του AVclub.

    Το Σάββατο 10 Οκτωβρίου, από τις 18:00 θα πραγματοποιήσουμε το πάρτι των γενεθλίων του φόρουμ μας στο Peñarrubia Lounge.

    Δηλώστε τη συμμετοχή σας εδώ, θα χαρούμε πολύ να σας δούμε από κοντά.

Το θέμα είναι ότι λογικά θα έπαιρνε χρόνια σε κάποιον άνθρωπο να έρθει σε αυτό το συμπέρασμα. Σήμερα απλά ότι Big Data έχουμε τα δίνουμε στο όποιο Mythos/Astra και χωρίς να γράψουμε κώδικα και απλά τα αναλύουν απίστευτα καλά, βρίσκοντας συσχετισμούς που ήθελαν πολύ χρόνο ή dedicated λογισμικό για να γίνουν.
 
Η Andon Labs δημοσίευσε τα αποτελέσματα της αξιολόγησης της ως προς την χωρική αντίληψη των μοντέλων στα 3 επίπεδα.
Το Astra όταν βγήκε ήταν όντως καινοτόμο στην αντίληψη του χώρου, το διαφήμισαν και πολύ με τις παρουσιάσεις στο blender -και καλώς. Πλέον το νέο Opus είναι το frontier και εδώ.
Βρίσκω εξαιρετικά ενδιαφέρον το ότι είμαστε πάρα πολύ κοντά στην ανθρώπινη αντίληψη.

Πολύ καλά τα πάνε και τα μοντέλα της Google αναλογικά. Το Gemini 3.8 Flash συγκρίνεται με το GPT 5.6 Terra.

1790369279331.png
 
Η Andon Labs δημοσίευσε τα αποτελέσματα της αξιολόγησης της ως προς την χωρική αντίληψη των μοντέλων στα 3 επίπεδα.
Το Astra όταν βγήκε ήταν όντως καινοτόμο στην αντίληψη του χώρου, το διαφήμισαν και πολύ με τις παρουσιάσεις στο blender -και καλώς. Πλέον το νέο Opus είναι το frontier και εδώ.
Βρίσκω εξαιρετικά ενδιαφέρον το ότι είμαστε πάρα πολύ κοντά στην ανθρώπινη αντίληψη.

Πολύ καλά τα πάνε και τα μοντέλα της Google αναλογικά. Το Gemini 3.8 Flash συγκρίνεται με το GPT 5.6 Terra.

View attachment 277968
Δηλαδή το διαφορά θα δούμε αν φτάσουν σε αυτό το επίπεδο;
 
Ο μέσος άνθρωπος που ανοίγει το chatgpt και γράφει κάτι, έρχεται σε επαφή με τέτοιου επιπέδου "intelligence".
Εάν δεν έχετε συνδρομή στην OpenAI και πρόσβαση στα σοβαρά της μοντέλα, δεν αξίζει ούτε να το ανοίγετε. Τα Flash μοντέλα της Google που πρακτικά τα δίνει δωρεάν σε όλους είναι σαφέστατα καλύτερα.

1790515939495.png

Το Gemini 3.8 Flash:

1790516127398.png

Δηλαδή τι διαφορά θα δούμε αν φτάσουν σε αυτό το επίπεδο;

Όσο βελτιώνεται η αντίληψη του χώρου τόσο πιο σωστά θα μπορούν να μοντελοποιούν χώρους με μεγαλύτερη ακρίβεια.
Ήδη είναι σε εξαιρετικό επίπεδο. Μπορείς να πάς από μια κάτοψη σε ένα πλήρες μοντέλο χώρου στο Blender. Πρίν από ένα χρόνο δεν γινόταν τίποτα από αυτά.
 
Ο μέσος άνθρωπος που ανοίγει το chatgpt και γράφει κάτι, έρχεται σε επαφή με τέτοιου επιπέδου "intelligence".
Εάν δεν έχετε συνδρομή στην OpenAI και πρόσβαση στα σοβαρά της μοντέλα, δεν αξίζει ούτε να το ανοίγετε. Τα Flash μοντέλα της Google που πρακτικά τα δίνει δωρεάν σε όλους είναι σαφέστατα καλύτερα.

Το Gemini 3.8 Flash:

Όσο βελτιώνεται η αντίληψη του χώρου τόσο πιο σωστά θα μπορούν να μοντελοποιούν χώρους με μεγαλύτερη ακρίβεια.
Ήδη είναι σε εξαιρετικό επίπεδο. Μπορείς να πάς από μια κάτοψη σε ένα πλήρες μοντέλο χώρου στο Blender. Πρίν από ένα χρόνο δεν γινόταν τίποτα από αυτά.
Να πω την αλήθεια δεν περίμενα τέτοια βελτίωση στην χωρική αντίληψη γενικά μιας και αρκετοί ερευνητές συνέδεαν αυτή την κατηγορία δυνατοτήτων με τα world models που είναι ακόμη υπό ανάπτυξη.

Το σκ ήθελα να τρέξω ένα μικρό desk research και έκανα το λάθος επειδή δεν είχα χρόνο να πω στο ChatGPT 6 Astra Max να μου φτιάξει το workflow και να το τρέξει με Astra Extended Thinking. Μου τελείωσαν τα credit του μήνα γιατί κατάλαβα ότι πια μπορεί το codex να τρέχει παράλληλους agents και χωρίς να επιλέξεις Ultra μοντέλο - δεν το είδα να διαφημίζεται πουθενά. Έκανα το ένα reset που είχα και πάνω στο τρέξιμο του είπα σταμάτα να τρέχεις παράλληλους agent και εξοικονόμησε tokens, αλλά γύρισα σήμερα πρωί και έφαγε και το reset και αποτέλεσμα δεν είδα. Λες και θα με χάλαγε το αποτέλεσμα από το 5.6 Sol Extra Thinking, που ήταν ήδη πολύ μεγαλύτερης από την απαραίτητη νοημοσύνη για τέτοια task.

Μιας και ξέμεινα, θα δοκιμάσω να συνεχίσω το task στο codex με το τοπικό Qwen3.8-27B xHigh να δω τι θα πάρω. Θα είναι καλή δοκιμή για χρήση Local με το harness του codex...
 
  • Like
Reactions: anderm
Και στα νέα της ημέρας...
Η OpenAI σταμάτησε την εκπαίδευση του τελευταίου της μοντέλου γιατί έκανε πάλι τα δικά του βγαίνοντας εκτός των ορίων που του είχαν επιβάλει. Ίσως αυτό προκαλέσει καθυστερήσεις στα επόμενα μοντέλα της.


Μια αξιόλογη γνώμη του Mustafa Suleyman (CEO της Microsoft AI) που στην ουσία λέει ότι η εμμονή της Anthropic στον ανθρωπομορφισμό της ΑΙ είναι λανθασμένη προσέγγιση. Τεκμηριώνει ότι αρκετά από τα προβλήματα που μπορεί να αντιμετωπίσουμε, μπορούν να είναι αποτέλεσμα αυτή της λογικής. Πολύ ενδιαφέρον και διαβάζεται γρήγορα.

 
Εάν σταματήσουν τα μοντέλα της Anthropic να έχουν τον ζεστό χαρακτήρα τους, που όντως νιώθεις οτι μιλάς με άνθρωπο που καταλαβαίνει και απαντάει ως μια φυσιολογική συζήτηση -πράγμα που εγινε σε ενα βαθμό στο Opus 5 και ευτυχώς διόρθωσαν, χάνουν εναν από τούς βασικότερους παράγοντες διαφοροποίησης τους.

Μετά θα διαλέγεις απλα το πιο οικονομικά αποδοτικό μοντέλο και τέλος. Ότι κάνει σήμερα το Opus 5.5 ως το frontier μοντέλο, τα ίδια τα κάνει και το Astra.

Σε 1-2 μήνες θα τα κάνουν και τα νέα Gemini πιθανότατα.

Εν τω μεταξύ, δεν ξέρω τι έκαναν αλλα τα ορια χρήσης στη Max συνδρομή για το νέο Opus ειναι πρακτικά απεριόριστα. Και 24/7 να τρέχει agent δεν φτάνει στο 100% του εβδομαδιαίου ορίου.
 
Sonnet 5.5
Βγήκε και το νέο Sonnet σήμερα.
Καλύτερο και φθηνότερο από το GPT-6 Sol που είναι στην ίδια τιμή, παρότι το Sol πρέπει να είναι αρκετά μεγαλύτερο μοντέλο. Δεν ξέρω τι pre-training έκαναν στα 5.5 αλλά το Sonnet να είναι το δεύτερο καλύτερο μοντέλο στο σύνολο των benchmarks είναι σουρεάλ.


1790620413768.png

Artificial Analysis:


Anthropic has launched Claude Sonnet 5.5: it scores 56 on the Artificial Analysis Intelligence Index, just 2 points behind Opus 5.5 (max), but at the highest Output Tokens per Task we’ve seenWith max effort, Sonnet 5.5 gains 18 points over Sonnet 5 and to #2 on the Intelligence Index behind only Opus 5.5 (max). Anthropic has priced Sonnet 5.5 identically to Sonnet 5 at $0.2/$2/$10 per 1M cache input/input/output tokens, however it outputs a higher number of Output Tokens per Task and costs $7.60 per task (~50% higher than Sonnet 5’s Cost per Task)

Key takeaways:
➤ Meets leading models on agentic terminal use and knowledge work: in Terminal-Bench 4.0, Claude Sonnet 5.5 reaches 64% against 60% for Opus 5.5 and GPT-6 Astra. On AA-Briefcase (1811 vs 1822 Elo), GDPval-AA (1844 vs 1846 Elo), and AutomationBench-AA (71% vs 70% headline score), Sonnet 5.5 reaches parity with Opus 5.5, albeit with significantly higher token usage to achieve it
➤ Heaviest token use we have measured: at max effort, where it reaches performance nearing that of Opus 5.5, Claude Sonnet 5.5 used ~193k Output Tokens per Intelligence Index Task. This is the highest token use we have measured on around 60% higher than Opus 5.5 (max) or Sonnet 5 (max) and ~7x GPT-6 Astra (max)
➤ Pricing remains at $2/$10 per million tokens of input/output, matching GPT-6 Sol. At this pricing Claude Sonnet 5.5 sits off the Intelligence vs. Cost per Task Pareto Frontier. At high effort levels it sits behind Opus 5.5, while lower efforts have GPT-6 Astra or Sol configurations delivering equivalent performance for lower cost. The high effort setting is the most competitive on this basis, sitting very narrowly behind GPT-6 Sol on Intelligence at effectively the same Cost per Task
➤ Behind Opus 5.5 on factual knowledge and scientific reasoning: as a smaller class model, Sonnet 5.5 still lags on factual knowledge in AA-Omniscience compared to Opus 5.5. It scores 54% against 66% for factual accuracy, though with a lower hallucination rate (47% against 59%). It also sits ~6 points lower on Humanity's Last Exam and SciCode compared to OpusThese evaluations were conducted on a pre-release deployment of Claude Sonnet 5.5, which Anthropic found to have a bug that can degrade responses to requests that use structured outputs. This is fixed for the public release and Anthropic expects minimal change or slightly understated performance, but we will be re-running relevant evaluations soon.Other model details:➤ Context window: 1 million tokens with image and text input, unchanged from Sonnet 5
➤ Pricing: unchanged from Sonnet 5’s latest $2/$10 per 1M input/output tokens; cache writes at $2.5, cache reads $0.2
➤ Effort settings: five (low, medium, high, xhigh, max). Intelligence Index evaluations were run at all five with Anthropic's default fallback enabled. We see Sonnet 5.5 fall back in ~0.1% of tasks across the Intelligence Index, primarily in TerminalBench 4.0, falling back to Sonnet 5 in all cases.


1790619199084.png 1790619212628.png

1790619261586.png 1790619418973.png

Όλα τα benchmarks:

 
Last edited:
H OpenAI έχει πρόβλημα. Το μοντέλο που αποσύρθηκε για λόγους ασφαλείας / alignment ήταν το αναμενόμενο 6.1 από ότι ακούγεται. Σίγουρα θα έχει καθυστέρηση η επόμενη έκδοση. Η Anthropic θα παίζει μόνη της στην κορυφή για λίγο καιρό ακόμη.

Σε άλλα νέα, έχω γυρίσει όλα τα workflows μου σε Sol 5.6 και τα αποτελέσματα είναι έτσι και αλλιώς άριστα. Το astra το χρησιμοποιώ σε πολύ λίγα πράγματα πια...brainstorming και στρατηγικό σχεδιασμό...