0.00%
0.14%
4.05%
BTC
$64,956.59
0.11%
0.03%
4.34%
ETH
$1,915.44
0.24%
0.36%
3.53%
BNB
$605.34
0.08%
0.45%
3.09%
XRP
$1.03
0.20%
0.36%
6.03%
SOL
$76.66
0.20%
0.49%
1.40%
TRX
$0.33134819
0.01%
0.31%
0.93%
DOGE
$0.06986329
0.08%
0.60%
4.47%
ADA
$0.19482483
0.10%
0.33%
1.23%
LINK
$8.26
0.26%
2.01%
2.90%
LTC
$45.33
0.00%
0.14%
4.05%
BTC
$64,956.59
0.11%
0.03%
4.34%
ETH
$1,915.44
0.24%
0.36%
3.53%
BNB
$605.34
0.08%
0.45%
3.09%
XRP
$1.03
0.20%
0.36%
6.03%
SOL
$76.66
0.20%
0.49%
1.40%
TRX
$0.33134819
0.01%
0.31%
0.93%
DOGE
$0.06986329
0.08%
0.60%
4.47%
ADA
$0.19482483
0.10%
0.33%
1.23%
LINK
$8.26
0.26%
2.01%
2.90%
LTC
$45.33
   /       /       /    Nvidia показала систему для навчання роботів

Nvidia показала систему для навчання роботів

Nvidia показала систему для обучения роботов

Дослідники Nvidia, Carnegie Mellon University і Каліфорнійського університету в Берклі представили ENPIRE — фреймворк, який дозволяє ШІ-агентам для програмування покращувати політики керування роботами на реальному обладнанні.

Система запускає замкнений цикл: робот виконує завдання, середовище автоматично оцінює результат і повертається у вихідний стан, а ШІ-агент аналізує помилки, переписує код і запускає наступну серію випробувань.

Як працює ENPIRE

У робототехніці навчання на реальному обладнанні залишається дорогим і повільним процесом. Після невдалої спроби потрібно повернути сцену у вихідний стан, перевірити результат, змінити алгоритм і знову провести випробування. Зазвичай частина цієї роботи вимагає участі інженерів.

ENPIRE переносить у фізичний світ підхід, який у Nvidia називають AutoResearch: ШІ-агенти пишуть код, тестують його й покращують у наступних ітераціях. Однак на відміну від цифрового середовища тут кожен експеримент пов’язаний з реальними роботами, камерами, об’єктами, помилками захоплення, тертям та іншими фізичними обмеженнями.

Фреймворк складається з чотирьох модулів:

  • Environment відповідає за автоматичне скидання сцени, перевірку результату, логування та інтерфейси безпеки;
  • Policy Improvement запускає покращення політики керування;
  • Rollout оцінює політику на одному чи кількох фізичних роботах;
  • Evolution дозволяє агентам аналізувати логи, шукати ідеї в літературі, змінювати інфраструктуру навчання та виправляти код.

Після первинного налаштування середовища цикл може йти без постійного спостереження людини. Агент отримує дані з відео, траєкторій і функції винагороди, пропонує нову гіпотезу, змінює код, тестує результат на роботі та зберігає зміни, якщо вони покращують показник.

Навіщо потрібні автоматична перевірка та скидання

Ключовий елемент ENPIRE — автоматизація двох операцій: перевірки результату та повернення сцени у вихідний стан. Перша потрібна для того, щоб система могла сама визначити, чи виконане завдання. Наприклад, у сценарії з кабельною стяжкою функція оцінки об’єднувала детектор, сегментаційну модель і перевірку за двома камерами. Так агент отримував сигнал успіху чи помилки без ручного розмічання кожного прогону.

Автоматичне скидання дозволяє запускати багато спроб поспіль. Після невдалої дії робот має повернути об’єкт або сцену в стан, придатний для наступного експерименту. Без цього навчання на реальному обладнанні швидко впирається в потребу постійної участі людини.

Як зазначили в Decrypt, на першому етапі людина допомагає агенту створити постійні інструменти — процедуру скидання та функцію винагороди. Після цього вони використовуються повторно, а агент бере на себе подальше покращення політики.

Що показали на роботах

У реальних експериментах команда тестувала ENPIRE на кількох завданнях маніпуляції. Push-T перевіряє, чи може робот штовхати T-подібний об’єкт у задану зону. Pin Insertion вимагає вставляти штирі в отвори діаметром 4 мм. Також показано встановлення GPU й операції з кабельною стяжкою.

На сторінці проєкту Nvidia зазначено, що в реальних завданнях маніпуляції система успішно справлялася із завданням у 99% випадків, якщо агенту давали до восьми спроб з урахуванням попередніх помилок. Показник відображає здатність системи відновлюватися після невдач і повторювати дії з урахуванням контексту, а не точність однієї ізольованої спроби.

Як агентів для програмування команда порівняла Codex на GPT-5.5, Claude Code на Opus 4.7 і Kimi Code на Kimi K2.6. Оцінка проходила в бенчмарку AutoEnvBench на завданнях Push-T і Pin Insertion.

Дослідники також перевірили ENPIRE у RoboCasa — симуляторі побутових завдань на кшталт відкривання шаф, шухляд і вмикання чи вимикання об’єктів на кухні. У цих сценаріях ENPIRE перевершив GR00T від Nvidia і CaP-X — агентну систему, яка використовує інструменти, але не запускає повний цикл автоматичного дослідження.

Вісім роботів пришвидшили навчання

Окремий блок роботи присвячено масштабуванню на парк роботів. Nvidia провела експеримент на восьми роботизованих станціях із двома маніпуляторами. Кожна мала власне обладнання, комп’ютер і ШІ-агента для програмування.

Станції обмінювалися результатами через Git: вдала ідея або зміна коду могли швидко поширюватися між агентами. Такий підхід дозволив скоротити час навчання. За даними Decrypt, перехід від одного робота до восьми скоротив час освоєння Push-T приблизно з п’яти до двох годин. Для Pin Insertion час знизився з понад 90 хвилин до близько 40 хвилин.

Обмеження

Автори підкреслили, що масштабування не розв’язує всіх проблем. Коли агенти читають логи, пишуть код, налагоджують його або чекають на відповідь базової мовної моделі, роботи й обчислювальні ресурси використовуються не повністю. Зі зростанням кількості роботів збільшується GPU-активність, але середнє завантаження самих роботів знижується. Команди агентів витрачають більше часу на узагальнення результатів інших гілок і координацію, а не лише на фізичні прогони.

Ще одне обмеження — зростання витрати токенів. Більший парк роботів швидше приводить політику до робочого стану, але вимагає більше токенів через читання логів, обмін ідеями та координацію між агентами.

Крім того, ENPIRE поки що показано на обмеженому наборі завдань маніпуляції. Його результати не означають, що роботи вже можуть самостійно освоювати довільні фізичні навички у відкритому середовищі без інженерної підготовки.

Нагадаємо, у червні Nvidia представила Isaac GR00T Reference Humanoid Robot — дослідницький референс-дизайн для розробки й тестування навичок гуманоїдних роботів. У конфігурацію ввійшли корпус Unitree H2 Plus і тактильні п’ятипалі кисті Sharpa Wave.

Раніше Unitree представила «першого у світі готового до серійного виробництва» пілотований робот. Андроїд здатний пересуватися на двох і чотирьох кінцівках.

Джерело: ForkLog

18-06-2026
Криптовалюти / Новини у світі криптовалют

Новини у світі криптовалют

Alibaba представила ШІ-моделі для керування роботамиAlibaba представила ШІ-моделі для керування роботамиGPU-майнери для AMD і Nvidia з підтримкою ProgPoWGPU-майнери для AMD і Nvidia з підтримкою ProgPoW

Випадкова цитата про гроші

"Бедные видят в богатстве проявления судьбы, богатые - результат собственного труда."

Франтишек Крышка

Цікаві записи в інших розділах блогу

Інформаційне повідомлення

Відвідувачі, які знаходяться в групі Гості, не можуть залишати коментарі до даної публікації.

Останні матеріали

усі статті →
3 Altcoins Post Double-Digit Gains as Bitcoin (BTC) Reclaims $65K: Market WatchНовини у світі криптовалют3 Altcoins Post Double-Digit Gains as Bitcoin (BTC) Reclaims $65K: Market WatchOne of the alts in question has entered the top 100 coins by market cap after its massive daily, weekly, and monthly rally.10-08-2026LBank Launches Crypto Resilience Initiative, Building on Its Security Collaboration with CertiKНовини у світі криптовалютLBank Launches Crypto Resilience Initiative, Building on Its Security Collaboration with CertiK[PRESS RELEASE – Singapore, Singapore, August 10th, 2026] LBank today announced the launch of the Crypto Resilience Initiative, an effort to support the10-08-2026Ansem Predicts Pump.fun’s Token Could Join Crypto’s Top 10 by 2028Новини у світі криптовалютAnsem Predicts Pump.fun’s Token Could Join Crypto’s Top 10 by 2028Crypto trader Ansem predicts Pump.fun (PUMP) could become one of the 10 largest cryptos by market capitalization within two years. Ansem said he plans to track10-08-2026BOJ Rate Hike Pace Could Speed Up as Inflation Nears TargetНовини у світі криптовалютBOJ Rate Hike Pace Could Speed Up as Inflation Nears TargetThe Bank of Japan’s latest policy meeting pointed to a possible acceleration in interest rate hikes, with at least three board members saying the central bank10-08-2026BIP-110 Soft Fork Implodes: Mines Just Two Blocks Before Grinding to a HaltНовини у світі криптовалютBIP-110 Soft Fork Implodes: Mines Just Two Blocks Before Grinding to a HaltBIP-110 supporters insist the proposal remains viable, despite the minority chain falling dozens of blocks behind Bitcoin's main chain.10-08-20263 Token Unlocks to Watch in the Second Week of August 2026Новини у світі криптовалют3 Token Unlocks to Watch in the Second Week of August 2026The cryptocurrency market will welcome a wave of tokens worth more than $605.5 million in the second week of August 2026. Major projects, including YZY (YZY),10-08-2026The Korean Crypto Laundering Method Behind $6.4 Billion, and Why Police Struggle to Stop ItНовини у світі криптовалютThe Korean Crypto Laundering Method Behind $6.4 Billion, and Why Police Struggle to Stop ItA single cross-border laundering method has quietly become the backbone of South Korea’s crypto crime wave, accounting for $6.4 billion of the $7.1 billion in10-08-2026Coinsbuy Faces Reported $7.9 Million Crypto Hack Amid Rising 2026 AttacksНовини у світі криптовалютCoinsbuy Faces Reported $7.9 Million Crypto Hack Amid Rising 2026 AttacksCoinsbuy reportedly suffered a $7.9 million crypto theft. Wallets linked to the crypto payments platform were drained across Ethereum (ETH) and Tron (TRX).10-08-2026Another Big Macro Week Is Here: 3 Events That Could Move BitcoinНовини у світі криптовалютAnother Big Macro Week Is Here: 3 Events That Could Move BitcoinBTC and the crypto market are entering another potentially volatile trading week because of these factors.10-08-2026
УвійтиMasterInvest
RUENUK