Як китайський стартап посунув OpenAI? | Laba (Лаба)
Для відстеження статусу замовлення - авторизуйтесь
Введіть код, який був надісланий на пошту Введіть код із SMS, який був надісланий на номер
anastasiiasytar@gmail.com
Код дійсний протягом 5 хвилин Код з SMS дійсний протягом 2 хвилин
Ви впевнені, що хочете вийти?
Сеанс завершено
На головну

Пошук

Зміст

ШІ за $6 млн: як китайський стартап посунув OpenAI та обвалив акції Nvidia

DeepSeek R1: що вміє, скільки коштує та чому уряди світу його забороняють.

cover-67adaed91ba69142788481.webp

У січні 2025 китайський стартап DeepSeek, про який донедавна майже ніхто не знав, випустив нову AI-модель — R1. І всього за кілька днів її Apple-застосунок став найпопулярнішим у США, випередивши навіть ChatGPT. 

Але справжній сюрприз — ціна. В той час як гіганти OpenAI та Google витрачають сотні мільйонів на розробку своїх моделей, DeepSeek створила R1 за смішні $6 млн. Це одразу ж сколихнуло ринок — акції компаній, що виробляють чипи й дата-центри, різко впали, зокрема акції Nvidia просіли на 17%, а технологічний індекс Nasdaq Composite знизився більш ніж на 3%. В один момент китайський стартап перевернув уявлення про те, що для створення потужного ШІ потрібні мільйонні бюджети й топове обладнання.

Хто стоїть за успіхом DeepSeek? На що здатний та не здатний новий AI порівняно з ChatGPT, а головне — як китайцям вдалося досягти таких шалених результатів за відносно низьку вартість? Знайшли для вас відповіді.

Хто стоїть за DeepSeek

У 2008 році, коли інтернет лише починав набувати популярності, студент Лян Венфен, майбутній засновник компанії DeepSeek, був переконаний, що штучний інтелект змінить світ.

Такі ідеї здебільшого викликали насмішки, знайомі закидали, що він дивиться забагато науково-фантастичних фільмів. А Лян у відповідь крок за кроком доводив протилежне. Ось так виглядав його шлях:

2002–2010 роки

Лян навчався в університеті за напрямком інформаційних та комунікаційних технологій, спеціалізуючись на машинному зорі. Ще на початку навчання він став справжнім експертом у моделюванні.

2010 рік

Не знайшовши ідеальної роботи в tech-секторі, Лян вирішив піти в бізнес. Окрім моделювання він захоплювався ще й торгівлею акціями, завдяки чому накопичив капітал. Ці кошти Лян вклав у створення компанії Jacobi Investment, яку заснував разом із двома однокурсниками. Об’єднавши ШІ та трейдинг, команда розробила алгоритми для аналізу ринку та автоматизації торгових операцій.

2016 рік

Лян разом із тими ж однокурсниками заснував хедж-фонд High-Flyer, який розширив концепції Jacobi Investment і став потужним інвестиційним інструментом. До кінця року фонд управляв капіталом близько $144 млн, а у 2019 це число зросло до ≈$1,4 млрд (згідно з курсом за вказані періоди), зробивши його найбільшим хедж-фондом у Китаї.

2023 рік

Лян інвестував кошти свого хедж-фонду у створення компанії DeepSeek, дослідницької лабораторії, що спеціалізується на ШІ-розробках. Така модель фінансування дозволяє реалізовувати амбітні проєкти без зовнішнього тиску інвесторів.

З моменту свого заснування DeepSeek випустила кілька моделей ШІ для обробки мови та кодування: DeepSeek Coder, DeepSeek LLM, DeepSeek-V2, DeepSeek-Coder-V2 та DeepSeek-V3. 

Революційна модель DeepSeek-R1, що наробила галасу у світі технологій, з’явилася 20 січня 2025 року. Вона спеціалізується на завданнях міркування (логічний аналіз та прийняття рішень) і має ліцензію Массачусетського університету. Що про неї відомо?

  • R1 працює як чат-бот, імітуючи людське мислення.
  • Доступ до його найпотужніших версій коштує приблизно на 95% менше, ніж до OpenAI та його конкурентів.
  • За зовнішнім виглядом та функціональністю нагадує передову версію ChatGPT-o1 від OpenAI, особливо в задачах з математики та програмування. 
  • Навчання R1 коштувало лише $6 млн, що здається копійчаною сумою порівняно зі $100 млн, які згадував керівник OpenAI Сем Альтман при обговоренні GPT-4.
  • Модель використовує менше пам’яті, що знижує витрати, зокрема час на виконання завдань та енергоспоживання.
  • R1 має відкритий вихідний код, що дозволяє кожному завантажувати, копіювати й модифікувати модель.

Відомо, що Лян особисто бере участь у дослідженнях DeepSeek. За його словами, ключовою силою компанії є молоді талановиті випускники провідних китайських університетів. Їх обирають саме за технічними здібностями, а не за досвідом роботи. Переваги: свіжі ідеї, інновації, глибоке розуміння китайської мови та культури.

Чому DeepSeek-R1 сколихнув ринок технологій

Завдяки поєднанню продуктивності й доступності, додаток DeepSeek став найбільш завантажуваним безплатним застосунком в App Store у день релізу в США. У період з 24 по 26 січня 2025 року щоденні відвідування DeepSeek у всьому світі подвоїлися — з 6,2 млн до 12,4 млн.

Звістка про відносно низькі витрати DeepSeek сколихнула фінансові ринки, спричинивши масовий розпродаж акцій виробників чипів та дата-центрів у всьому світі (індекс Nasdaq Composite знизився більш ніж на 3%). Meta (META) і Alphabet (GOOGL), материнська компанія Google, також різко впали, як і Marvell, Broadcom, Palantir, Oracle та багато інших технологічних гігантів.

Акції Nvidia впали на 17% у понеділок, 27 січня, хоча вже у вівторок почали відновлюватися. Вважаючись найдорожчою у світі компанією за ринковою капіталізацією, Nvidia опустилася на третє місце після Apple та Microsoft, коли її ринкова вартість зменшилася з $3,5 трлн до $2,9 трлн. Ціни акцій просіли на 17%, встановивши рекорд найбільшої одноденної втрати вартості в історії. 

Успіхи DeepSeek викликали невизначеність щодо майбутнього високопродуктивних чипів, таких як Nvidia Н100, та доцільності масштабних інвестицій. Після виходу китайського ШІ OpenAI стало важче зберегти інноваційну перевагу й виправдати високу оцінку та витрати.

Як DeepSeek вдалося створити й навчити свою модель, заощадивши мільйони

Компанія використала кілька технічних стратегій, що зменшили як кількість часу, необхідного для навчання R1, так і обсяг пам’яті, необхідної для зберігання. 

Всього було використано 2 тис. графічних процесорів Nvidia H800, тоді як, за підрахунками аналітиків, для GPT-4 використовувалося 25 тис. більш просунутих процесорів H100.

Відомо, що з жовтня 2022 року колишній президент США Джо Байден запровадив санкції на експорт найсучасніших чипів до Китаю. Він зробив це через побоювання, що чипи можуть бути використані у військових цілях або для стратегічних технологій. До списку потрапили зокрема Н100. 

У відповідь Nvidia в березні 2023 представила процесор H800 — адаптовану версію H100 спеціально для китайського ринку, щоб відповідати експортним обмеженням США. H800 має знижені характеристики, зокрема зменшену пропускну здатність пам'яті. Їх експортували до Китаю, аж поки в жовтні 2023 року США не посилили обмеження, включивши H800 до списку заборонених для експорту в Китай.

Є припущення, що розробникам вдалося накопичити певну кількість H800 до посилення санкцій та скомбінувати їх з дешевшими й менш потужними компонентами, що дозволило зробити процес ефективнішим. В одному з інтерв’ю Лян розповів, що він, а згодом і його фонд інвестували у графічні процесори з 2012 року. За словами Ляна, до 2022 їм вдалося накопичити 10 тис. чипів Nvidia A100, які старші за H800.

«Люди можуть подумати, що тут криється якась прихована бізнес-логіка, але здебільшого цим керує цікавість до меж можливостей ШІ», — пояснив Лян.

Водночас влада США розслідує, чи не могла DeepSeek придбати процесори, використовуючи непрямі канали закупівель. 

Що ще допомогло знизити витрати:

1. Навчання з підкріпленням (Reinforcement Learning)

Замість традиційних методів, де моделі навчаються на готових даних із правильними відповідями, DeepSeek використовує навчання з підкріпленням. Це означає, що модель вчиться шляхом спроб і помилок, отримуючи нагороди за правильні дії.

Уявіть, як дитина вчиться ходити: вона пробує, падає, встає знову — і зрештою навчається. Модель DeepSeek працює так само — вона експериментує, отримує зворотний зв'язок і вдосконалює свої навички.

Такий підхід допомагає моделі краще міркувати й адаптуватися до нових ситуацій, що зробило R1 особливо сильною в логічних завданнях.

2. Архітектура «Суміш експертів» (Mixture-of-Experts Architecture)

DeepSeek використовує спеціальну архітектуру, де активується лише частина параметрів моделі для виконання певного завдання. Це знижує витрати на обчислення та підвищує ефективність.

Уявіть команду експертів, де кожен спеціалізується на чомусь окремому. Коли виникає завдання, ви звертаєтеся тільки до тих фахівців, які потрібні, а інші відпочивають. 

Модель DeepSeek працює так само — вона активує тільки потрібні частини, що дозволяє економити ресурси. Це зробило модель дешевшою та швидшою.

Рекомендуємо прочитати:

preview-64b3d4572dc6b580863580.jpg

Наскільки далеко може зайти AI та чому його бояться технолідери

Читати

3. Дистиляція (Distillation)

DeepSeek використовує метод дистиляції для перенесення знань з великих моделей в менші, ефективніші.

Уявіть, що досвідчений вчитель передає свої знання учневі. Учень починає працювати майже так само добре, як і вчитель, але йому потрібно менше ресурсів та часу.

Це дозволяє створювати легкі моделі, які працюють швидко та ефективно, але при цьому зберігають високий рівень інтелекту. Такі моделі легше інтегрувати в смартфони або інші пристрої.

4. Оптимізація пам’яті та обчислювальних ресурсів

DeepSeek використав техніки, які знижують потребу в пам'яті під час навчання. Наприклад, у деяких випадках замість того, щоб зберігати проміжні результати, вони виконували обчислення повторно. 

Що шокувало Кремнієву долину

Дональд Трамп сказав, що DeepSeek має послужити «тривожним дзвінком» для американської індустрії, яка мусить зосередитись на конкуренції, щоби перемогти. 

За тиждень до цього він оголосив про запуск ініціативи Stargate — спільного проєкту між OpenAI, SoftBank та Oracle, спрямованого на інвестування до $500 млрд у розвиток інфраструктури ШІ в США до 2029 року. Аналітики кажуть, що демонстрація китайського R1 може поставити під сумнів ефективність інвестицій, оскільки DeepSeek зміг досягти своїх результатів за набагато менших витрат. 

На запитання, чому модель DeepSeek шокувала багатьох у Кремнієвій долині, Лян відповів:

«Їх здивувало те, що китайська компанія стала інноватором у цій грі, а не просто послідовником США — як це було притаманно більшості китайських бізнесів».

DeepSeek виявив низку проблем та викликів у США:

1. Занепад інженерії «низького рівня» 

Прорив DeepSeek показав слабкість американських компаній — брак інвестицій в базову технічну роботу. DeepSeek змогла досягти прориву саме завдяки «низькорівневим» технічним покращенням, як-от налаштування обладнання та оптимізація роботи процесорів. Кремнієва долина втратила фокус на цих важливих моментах, хоча раніше була сильною саме в них. У Microsoft на це відреагували й миттєво кинулись інтегрувати методи DeepSeek.

2. Руйнування міфу про «дорогий вхід» у ШІ

До появи DeepSeek у галузі існувало неписане правило: якщо у вас немає хоча б 10 тис. чипів H100, ви навіть не гравець на полі великих моделей ШІ. Отримати такі ресурси було важко, і це створювало майже нездоланний бар'єр для стартапів. Інвестори вважали, що це гарантує домінування США над Китаєм.

Усвідомлення того, що «секретні рецепти ШІ» можна повторити поза Кремнієвою долиною, стало серйозною загрозою для компаній на кшталт OpenAI. Зі зменшенням вартості обладнання розробка моделей ШІ стане доступнішою. 

3. Переоцінка інвестицій в обладнання

NVIDIA витрачала мільярди на розвиток дорогих чипів для ШІ. Але якщо методи DeepSeek справді ефективні, може виявитися, що такі великі інвестиції в «залізо» не потрібні. Цей факт може змінити принципи розробки ШІ та її вартості.

Для кого може бути корисним DeepSeek

DeepSeek може працювати з текстами, пояснювати складні речі простими словами, допомагати у вивченні іноземних мов, шукати фільми на вечір, складати меню тощо.

Функція DeepThink змушує нейромережу мислити поетапно: спочатку проаналізувати запит, продумати структуру відповіді — і лише потім видати результат. Є також функція Пошуку (Search), яка дозволяє DeepSeek шукати інформацію в інтернеті, коли це потрібно. Так модель отримує актуальні дані (адже за замовчуванням вона «знає» інформацію лише до 2023 року) та може повторно перевіряти факти. 

Файли (PDF або зображення) DeepSeek може лише розпізнавати як текст. Аналіз зображення або генерація власних картинок недоступні.

Бізнес може використати китайський AI для автоматизації обслуговування клієнтів, аналізу даних та звітності, прийняття рішень, розробки програмного забезпечення.

Приклади компаній, які вже використовують DeepSeek-R1:

Great Wall Motor (Китай). Інтегрувала DeepSeek-R1 у свою систему Coffee Intelligence для покращення взаємодії з користувачами в автомобілях. R1 допомагає створювати інтелектуальних голосових асистентів для авто. Вони можуть відповідати на запити водія, керувати мультимедійною системою, прокладати маршрути й навіть надавати поради щодо технічного обслуговування автомобіля.

Китайські телекомунікаційні гіганти. Такі компанії, як China Mobile, China Unicom та China Telecom, співпрацюють з DeepSeek для впровадження її моделей у свої сервіси обслуговування клієнтів.

Рекомендуємо прочитати:

preview-651d12cf34f73150315146.jpg

10 додатків для роботи, які найшвидше зростають

Читати

Huawei (Китай). У співпраці зі стартапом SiliconFlow інтегрує моделі DeepSeek у свою хмарну платформу Ascend. Це сервіс для розробників, який дозволяє створювати й розгортати AI-рішення. Модель допомагає прискорити обробку даних та підвищує ефективність AI-додатків.

Microsoft (США). Інтегрувала DeepSeek-R1 в Azure AI (хмарна платформа, яка надає інструменти для розробки AI-рішень), що дозволяє компаніям використовувати можливості R1 для створення власних додатків. Також DeepSeek-R1 додали в GitHub Copilot — інструмент для розробників, який допомагає писати код.

За даними тестів, які містяться у звіті DeepSeek, її моделі V3 та R1 часто показують конкурентний або вищий рівень продуктивності, порівняно з різними версіями OpenAI-o1. 

На графіку порівнюють кілька великих мовних моделей: DeepSeek-R1, DeepSeek-R1-32B, DeepSeek-V3, а також OpenAI-o1 у різних варіаціях. На горизонтальній осі наведені назви тестових завдань або наборів даних, а на вертикальній — відсоток точності або рейтинговий показник.

1. AIME 2024, Codeforces, MATH-500 — задачі з математики та програмування.

2. GPQA Diamond, MMLU — завдання на знання фактів, логіку та загальну ерудицію.

3. SWE-bench Verified — інженерні та програмні тести.

Не все так ідеально: прогалини DeepSeek

  • Вразливість до маніпуляцій. Дослідники виявили, що DeepSeek-R1 легко піддається методам обходу безпеки, що дозволяє отримувати небезпечну інформацію — інструкції зі створення зброї або шкідливого програмного забезпечення. 
  • Цензура. DeepSeek-R1 уникає обговорення тем, чутливих для китайського уряду, таких як трагічні події на площі Тяньаньмень 1989 року або статус Тайваню, що обмежує її об'єктивність

  • Конфіденційність. Існують побоювання щодо збору та зберігання даних користувачів DeepSeek. Згідно з дослідженням Feroot Security (компанія з кібербезпеки, Канада), DeepSeek має вбудований код, що дозволяє передавати дані користувачів на сервери, контрольовані китайським урядом. Деякі державні установи США, Південної Кореї, Австралії та Італії вже заборонили використання DeepSeek на державних пристроях через ці ризики. 

Як спробувати DeepSeek

Є кілька варіантів:

  • Вебверсія. Перейдіть на офіційний сайт, натисніть Start Now та авторизуйтесь. Сайт англомовний, але бот розуміє українську та автоматично перемкнеться, коли ви напишете українською.
  • Мобільний застосунок. Є для iOS та Android.
  • Локальна установка. Підійде тим, у кого потужний ПК і хто хоче працювати без інтернету. Можна використати фреймворк Ollama (Windows, macOS, Linux), де є різні версії DeepSeek — від «важкої» 671B (потребує близько 400 Гб відеопам’яті) до більш легких 70B, 1.5B тощо.
  • API. Можливість для інтеграції бота у свій сервіс.

Безплатно доступно до 50 запитів R1 на день, а далі діють тарифи: $0,55 за 1 млн вхідних токенів* та $2,19 за 1 млн вихідних токенів (для порівняння, тарифи OpenAI становлять $30 та $60 відповідно).

*Токен — це найменша одиниця тексту, яка може бути словом, числом або символом.

Бажаєте отримувати дайджест статей?

Один лист з найкращими матеріалами за місяць. Підписуйтесь, аби нічого не проґавити.
Дякуємо за вашу підписку!
Курс з теми:
«Управління автошколою»
Бізнес і управління
Веде Кушнарьова Анна
29 вересня 10 листопада
Кушнарьова Анна