Τεχνητή Νοημοσύνη (AI). Τι είναι, τι ξέρουμε, τι αλλάζει στη ζωή και στον πολιτισμό;

  • Αγαπητοί φίλοι και φίλες,

    Σας προσκαλούμε να γιορτάσουμε μαζί τα 20α γενέθλια του AVclub.

    Το Σάββατο 10 Οκτωβρίου, από τις 18:00 θα πραγματοποιήσουμε το πάρτι των γενεθλίων του φόρουμ μας στο Peñarrubia Lounge.

    Δηλώστε τη συμμετοχή σας εδώ, θα χαρούμε πολύ να σας δούμε από κοντά.

Τον Φλεβάρη o CEO της Microsoft Satya Nadella προσομοίωσε το openclaw με ιό. Πριν από λίγες ημέρες η Microsoft έβγαλε στο κοινό το Autopilot. Το οποίο είναι βασισμένο στο Openclaw.
Μια χαρά!

Το μόνο Copilot προϊόν που χρησιμοποιώ και είναι τέλειο είναι το semantic search στα windows, το οποίο στην πράξη τρέχει τοπικά. Όλα τα υπόλοιπα τα χρησιμοποιώ μόνο εκεί που μου απαγορεύεται να χρησιμοποιήσω το ChatGPT. Φυσικά μόλις ενεργοποιηθεί στο λογαριασμό μου θα το χρησιμοποιήσω. Βάζω στοίχημα ότι θα είναι καλύτερο από το copilot όπως έχει ενσωματωθεί στο Word/Excel/Outlook...
 
Αύξησαν τη ταχύτητα του decode στις συνδρομές, όταν πρωτο-κυκλοφόρησε το 6.1 Sol ήταν δραματικά αργό, διπλασίασαν μια φορά το decode στα 30tok/sec και τώρα θα πάει στα 50tok/sec.

Στα LLM, η ταχύτητα decode εξαρτάται κυρίως από το "concurrency". Πόσα sessions εξυπηρετεί ταυτόχρονα το κάθε νοητό υποσύνολο της υποδομής. Όσους λιγότερους χρήστες βάζεις, τόσο μεγαλύτερη η ταχύτητα μέχρι περίπου τα ~250tok/sec.

1791231767049.png
 
Η semianalysis δημοσίευσε επικαιροποιημένο άρθρο-ανάλυση σχετικά με τις συνδρομές των OpenAI-Anthropic και την ενσωματωμένη χρήση.


1791235646594.png

1791235668226.png

1791235680472.png
 
Πως ακριβώς τα μέτρησαν αυτά;
1) Το fable 5.1 δουλεύει μόνο με credits, οπότε είναι 1:1
2) Και σε api χρησιμοποιείται cache. Αν ξέρεις να γράψεις, το harness του είναι όλο cached και μπορεί να του στέλνεις 100k και τα 99k να είναι cached.
3) Σε συνδρομή, το χρησιμοποιήσεις δεν το χρησιμοποιήσεις, θα την πληρώσεις.

Δεν είναι χαζοί. Μόνο λεφτά δεν θέλουν να χάσουν.
 
Το Fable περιλαμβάνεται στις Claude Max συνδρομές αλλά μέχρι το 50% της εβδομαδιαίας χρήσης.
Και μέσω του API χρησιμοποιείται η cache, προφανώς, αλλά στο API δεν είναι δωρεάν και έχει άλλο TTL. Στις συνδρομές "χρεώνεται" μόνο ένα μέρος του cache write, τα reads δεν υπολογίζονται στη χρήση και έχει TTL 1 ώρας αντί για τα 5 λεπτά που είναι το προεπιλεγμένο στο API.

Επειδή κάνουμε χρήση και από το Bedrock της AWS, το κόστος του API είναι σουρεαλιστικά μεγαλύτερο. Τα 100-200$ της συνδρομής είναι 1 ώρα χρήσης στο API.
 
  • Wow
Reactions: Kosh
Καλά δεν είναι υπερβολικό.
Για αρχή δεν χρειάζεται να χρησιμοποιήσει κανείς το Fable με πολλούς sub-agents κλπ. Το Opus 5.5 είναι αντίστοιχα καλό αν όχι καλύτερο στο 1/3 του κόστους.

Αλλά για να το δούμε λίγο.
Σε 1 ώρα, το Opus θέλει περίπου 30-40$ σε κόστη API. Για να δουλεύει επί μια ώρα με sub-agents Κλπ, σημαίνει πως το έχεις βάλει να κάνει βαρβάτο implementation.
Αυτό το βαρβάτο implementation που θα κάνει σε 1 ώρα, 2-3 developers με το σκερπάνι, πρέπει να δουλεύουν 3-4 μέρες για να το βγάλουν και αυτό αν είναι καλοί. Στις περισσότερες των περιπτώσεων σε 3 μέρες άντε να έχεις το spec γραμμένο.

Ένα γρήγορο cybersecurity sweep σε ένα module που έτρεξα εγώ το πρωί:

1791316461955.png

Για ~11 λεπτά ενεργής χρήσης του Mythos (σε 30 λεπτά session), μας κόστισε 8.5$
Δεν το θεωρώ κακή περίπτωση.
 
Last edited:
Νέο μεγάλο μοντέλο από την Ευρωπαϊκή Mistral -η οποία είχε χαθεί.

1791316815279.png

Mistral has released Mistral Large 4, scoring 38 on the Artificial Analysis Intelligence Index; France is back to having the most intelligent model from outside the US and China
@MistralAI
has released Mistral Large 4 in Research Public Preview, with plans to release the weights of the 1T parameter (49B active) model at the end of October. It achieves 38 on the Artificial Analysis Intelligence Index, comparable to GPT-6 Luna (max, 38) and DeepSeek V4.1 Flash (max, 39). It also achieves 50% on the Artificial Analysis Cyber Index, level with GLM-5.3-Flash and ahead of models such as Kimi K3 and DeepSeek V4.1 Flash (max).Key benchmarking results for Mistral Large 4 Preview:
➤ Most intelligent model from outside the US and China: Mistral Large 4 Preview scores 38 on the Intelligence Index, comparable to DeepSeek V4.1 Flash (max, 39) and GPT-6 Luna (max, 38). This makes it the most intelligent model from outside the US and China, ahead of countries such as South Korea and the United Arab Emirates
➤ Level with GLM-5.3-Flash on cyber defense capability: Mistral Large 4 Preview scores 50 on the Artificial Analysis Cyber Index, level with GLM-5.3-Flash (50) and behind MiMo-V2.6-Pro (56). Once its weights are released, it will rank among the top three open weights models on the Cyber Index. Its strongest result is on CyberGym-E2E-AA, where it scores 82%, ahead of MiMo-V2.6-Pro (79%) and GPT-6 Luna (max, 78%)
➤ Over 4x the Cost per Task of similar-intelligence open weights models: Mistral Large 4 Preview costs $1.13 per Intelligence Index task with standard pricing of $1.36/$4.18 per 1M input/output tokens, with $0.14 per 1M cached input tokens. For the first two weeks, Mistral Large 4 Preview will be served at a 50% launch discount, bringing its Cost per Task down to $0.57. This is still more costly than GLM-5.3-Flash ($0.25) and DeepSeek V4.1 Flash (max, $0.27)
➤ Strong document and image reasoning: Mistral Large 4 Preview scores 19% on GDP.pdf, on par with MiMo-V2.6-Pro (19%) and behind Kimi K3 (22%). This is an 18-point improvement from Mistral Large 3, partly driven by improvements in their API, which now accepts 100 images per request, up from 8 for previous Mistral modelsKey model details:
➤ Context Window: 512k tokens
➤ Multimodality: Text and image input, with text output
➤ Pricing: $1.36/$4.18 per 1M input/output tokens ($0.14 per 1M cached input tokens), with 50% off for the first two weeks ($0.68/$2.09
➤ Availability: Research Public Preview on Mistral's API, with open weights planned for the end of October

Σημειώστε πως εκπαιδεύτηκε σε 4000 Nvidia Blackwell GPUs, ενώ το GPT-6 Astra σε 100.000
Αναλογικά με την υποδομή που είχαν, έκαναν μια χαρά δουλειά.

Για να έχουμε μια τάξη μεγέθους, στα Benchmarks είναι στο επίπεδο του GPT 5.4 το οποίο πριν από λίγους μήνες ήταν frontier.

Όλα τα benchmarks:

 
Νέο μεγάλο μοντέλο από την Ευρωπαϊκή Mistral -η οποία είχε χαθεί.

View attachment 278664



Σημειώστε πως εκπαιδεύτηκε σε 4000 Nvidia Blackwell GPUs, ενώ το GPT-6 Astra σε 100.000
Αναλογικά με την υποδομή που είχαν, έκαναν μια χαρά δουλειά.

Για να έχουμε μια τάξη μεγέθους, στα Benchmarks είναι στο επίπεδο του GPT 5.4 το οποίο πριν από λίγους μήνες ήταν frontier.

Όλα τα benchmarks:
Κανένα μικρό να δούμε αν θα βγάλουν. Το προηγούμενο δεν κατάφερα καν να το κάνω να τρέξει :)
 
Έχει ξεφύγει ήδη η κατάσταση. Η OpenAI ανακοίνωσε ότι ετοίμασε 722 Paper λύνοντας διάφορα μαθηματικά προβλήματα. Λωρίδα παραγωγής κανονικά. Σε ένα μήνα πρακτικά όλα αυτά. Είναι όλα ανοικτά στο github. To Quasi-Riemann Hypothesis είναι αυτό που θα τραβήξει τα βλέμματα, αλλά και όλα τα υπόλοιπα είναι απλά απίστευτα. Δεν θα ήθελα να ήμουν υποψήφιος διδάκτορας να δουλεύω για 3-5 χρόνια πάνω σε κάποιο από αυτά και να δω ένα μοντέλο να φτύνει τη λύση σε 1 μήνα...

Οπότε το όποιο controversy και να υπήρχε στην επίλυση των Navier-Stokes τώρα κανείς δεν μπορεί να πει τίποτα...αφορούν 372 διαφορετικές οικογένειες μαθηματικών προβλημάτων...Α, και δεν μιλάμε για κάποιο dedicated math model, αλλά για το τυπικό μοντέλο που θα έχουμε σε 1-2 μήνες να το ρωτάμε πόση ώρα αντέχει το ρύζι έξω από το ψυγείο μετά το μαγείρεμα...



Υ.Γ. Το μεγάλο πρόβλημα είναι ότι δεν έχουμε αρκετούς ανθρώπους με το κατάλληλο υπόβαθρο για να ελέγξουν μέσω peer-review τα άρθρα αυτά σύντομα...
 
Υ.Γ. Το μεγάλο πρόβλημα είναι ότι δεν έχουμε αρκετούς ανθρώπους με το κατάλληλο υπόβαθρο για να ελέγξουν μέσω peer-review τα άρθρα αυτά σύντομα...
Θα βάλουμε αλλα AI να το κάνουν, και η πλάκα θα είναι οταν αρχίσουν να βρισκουν ευρήματα η άλλο δικο τους τρόπο επίλυσης πιο γρήγορο-έξυπνο (αρα περισσότερες λύσεις του ενος εντέλει)
 
Θα βάλουμε αλλα AI να το κάνουν, ...
Αυτό το έχει κάνει ήδη η OpenAI πριν καταθέσει τα paper. Σχεδόν όλα έχουν τις λύσεις σε γλώσσα LEAN που είναι αυτή που χρησιμοποιούν οι μαθηματικοί για να ελέγχουν τέτοια θέματα.
Αν λυθούν τα μαθηματικά, σειρά έχει η φυσική και μετά οι επιστήμες μηχανικού...
Και ότι λύθηκαν όλα αυτά σε 1 μήνα, απλά το concept του χρόνου για την εξέλιξη της επιστήμης έχει αλλάξει πέρα από όσο μπορούμε να συνειδητοποιήσουμε...
 
Βγήκε και το Claude Haiku 5.5, το μικρό μοντέλο τους.
Πολύ πιο "έξυπνο" και στην ίδια τιμή με το GPT-6 Luna για μέχρι τα 100k token context.
Δεν έχουμε ακόμη τα αποτελέσματα της artificial analysis βέβαια.


1791397163757.png
 
1791400793148.png

1791400852347.png

Anthropic has released Claude Haiku 5.5, scoring 43 on the Artificial Analysis Intelligence Index - up 26 points one year after the last Haiku releaseHaiku 5.5 is the first Haiku model with Anthropic’s effort settings and adaptive thinking, and Anthropic has introduced tiered pricing.Haiku 5.5 is cheaper than its predecessor - it costs $0.10/$0.50 per 1M input/output tokens for prompts up to 100k tokens (the same as GPT-6 Luna and 10% of the previous Haiku model). However, this pricing rises 5x to $0.50/$2.50 above 100k. The site does not yet reflect tiered pricing, so provisional cost figures for Haiku 5.5 do not include the step up cost. We are working on support and will follow up with Cost per Task coverage soon.Key takeaways:
➤ Leading small-class model performance: At max effort Haiku 5.5 sits slightly ahead of models such as GLM-5.3 Flash (42), Gemini 3.8 Flash (41) and GPT-6 Luna (38). Its score is comparable to Kimi K3 (44), a 2.8T parameter open weights model, and trails Claude Sonnet 5.5 (max, 56) by 13 points
➤ Heavy token use compared to GPT-6 Luna: Haiku 5.5 (max) uses ~162k output tokens per Intelligence Index task, ~3x GPT-6 Luna (max, ~50k). Moving from xhigh to max adds 2 points for ~1.8x the tokens. At similar intelligence it also uses more tokens than GPT-6 Luna: Haiku 5.5 (high) scores 38 with ~55k tokens per task against 38 with ~50k for Luna (max), and the gap widens at lower effort settings➤ Highly capable at agentic knowledge work: on AA-Briefcase, our private evaluation for realistic knowledge work tasks, Haiku 5.5 (max) reaches 1578 Elo, ahead of models including Kimi K3 and GLM-5.3, and comparable to Muse Spark 1.3 (max)
➤ Improvements on terminal use: on Terminal-Bench 4.0 it scores 33%, up from 0% for Haiku 4.5. This is level with GLM-5.3 Flash, and ahead of Gemini 3.8 Flash (20%) and GPT-6 Luna (13%)
➤ Lower factual knowledge, but relatively low hallucinations: as expected for a smaller-class model, Haiku 5.5 has lower factual knowledge than its siblings. AA-Omniscience accuracy is 36%, against 55% for Gemini 3.8 Flash and 44% for GPT-6 Luna, but this is partly driven by more willingness to admit when it doesn’t know - its hallucination rate is lower, at 40% against 55% and 77%
➤ AutomationBench-AA result likely understated: Haiku 5.5 scores 35%, against 53–60% for GPT-6 Luna, Gemini 3.8 Flash and GLM-5.3 Flash. During pre-release testing, a safety refusal issue caused the model to over-refuse. Anthropic is working on resolving this - we will re-run this evaluation with the fix, and expect this score to riseOther model details:
➤ Context window: 1 million tokens, up from 200k for Claude 4.5 Haiku
➤ Pricing: $0.10/$0.50 per 1M input/output tokens up to 100k tokens, $0.50/$2.50 above. Cache reads $0.01 ($0.05 above 100k), 5 minute cache writes $0.125 ($0.625 above 100k)➤ Multimodality: Text and image input, with text output