Google і Meta випустили конкуруючі ШІ-моделі з різницею в кілька годин: хто лідирує?

Google і Meta випустили свої новітні передові ШІ-моделі з різницею в кілька годин у середу. Google представила Gemini 3.8 Flash разом із версією для кібербезпеки, а Meta випустила Muse Spark 1.3.
Ці два релізи напрошуються на пряме порівняння. Незалежне тестування Artificial Analysis розділило результати. Meta лідирує в агентній роботі зі знаннями та науковому мисленні, тоді як Google має перевагу в точності фактів і термінальному кодингу.
Два передові релізи виходять в один день
Gemini 3.8 Flash — третій реліз лінійки Flash від Google за шість тижнів. Модель коштує $0,75 за 1 мільйон вхідних токенів та $3,75 за 1 мільйон вихідних токенів.
Підписуйтесь на нас у X, щоб отримувати останні новини в реальному часі
Ця вступна ціна діє до 31 грудня 2026 року. Після цього ціни подвояться — до $1,50 та $7,50 за 1 мільйон токенів.
Google доповнила базову модель версією Gemini 3.8 Flash Cyber. Модель доступна обмеженому колу довірених фахівців із захисту. Вона набрала 86,2% у CyberGym — тесті на пошук вразливостей.
Кібер-версія також досягла 47,2% у CWE-Bench — тесті на усунення вразливостей (патчинг). За даними Google, модель створювала у 2,6 раза більше коректних патчів для вразливостей Chrome, ніж більші комерційні моделі.
Доступ надається в рамках програми Fairwind, яка обмежує використання моделі державними структурами та операторами критичної інфраструктури. Днем раніше аналогічну межу провела OpenAI щодо Astra — першої моделі, яку компанія віднесла до критичного рівня загрози кібербезпеці.
Тим часом Meta випустила Muse Spark 1.3 через Muse Code та Meta Model API. За даними інженерів компанії, кількість викликів інструментів скоротилася приблизно на 20% порівняно з версією 1.2.
Gemini 3.8 Flash проти Muse Spark 1.3: незалежні тести розділили результати
Artificial Analysis протестувала обидві моделі, і результати показують їхнє розташування. Muse Spark 1.3 у режимі max набрала 1754 очки Elo в GDPval-AA v2. Gemini 3.8 Flash (high) показала 1545.
Meta також лідирувала в тесті банківського агента Sierra Research (52,4% проти 44,9%) і в тесті фізичного мислення CritPt. Gemini 3.8 Flash лідирувала в Terminal-Bench 2.1 з результатом 87,6%, у тесті довгого контексту AA-LCR з 81% і в точності AA-Omniscience з 55%.
Gemini 3.8 Flash показала найвищий результат GPQA Diamond серед протестованих моделей — 95%. У тесті Humanity’s Last Exam моделі розійшлися менш ніж на один бал.
Найкращий результат Meta поки що недоступний. За словами компанії, режим max reasoning з’явиться після завершення додаткового тестування безпеки, а поки доступна версія xhigh.
Ця версія набрала 61 бал в індексі Artificial Analysis Intelligence Index — на чотири бали більше, ніж Muse Spark 1.2. Вона поступається Claude Fable 5.1 із 66 балами та Claude Opus 5 із 63 балами.
У черзі вже перебувають нові релізи. Ілон Маск заявив, що Grok 4.7 вийде найближчим часом, і тоді за два тижні відбудеться чотири релізи передових моделей.
Підпишіться на наш YouTube-канал, щоб дивитися експертні думки лідерів галузі та журналістів
Source: BeInCrypto
Новини у світі криптовалют
Випадкова цитата про гроші
"Деньги - самое абстрактное и "безличное" из всего того, что существует в жизни людей."
















* для пошуку по базі проксі просто вводьте назву країни, наприклад: Росія, США, Таїланд