Китайская нейросеть DeepSeek: что это, как работает и почему она изменила рынок ИИ

Подробный разбор китайской нейросети DeepSeek: история создания, архитектура, модели V3 и R1, влияние на рынок, способы использования в России, ограничения и перспективы.

Что такое DeepSeek и почему о ней заговорил весь мир

DeepSeek — это семейство больших языковых моделей, разработанных одноимённой китайской компанией из Ханчжоу. Проект появился в 2023 году как исследовательское подразделение хедж-фонда High-Flyer, который с 2015 года использовал машинное обучение для торговли на фондовом рынке. Основатель компании Лян Вэньфэн ещё в 2021 году закупил около 10 000 графических процессоров Nvidia, которые первоначально использовались для анализа рыночных данных, а затем были переориентированы на задачи искусственного интеллекта.

Мировую известность DeepSeek получила в январе 2025 года после выхода модели R1. Её запуск вызвал резкое падение акций технологических компаний по всему миру: Nvidia потеряла около 600 миллиардов долларов капитализации за один день, а индекс Nasdaq 100 снизился на 3%. Причина такого эффекта — заявление разработчиков о том, что модель была обучена всего за 5,6 миллиона долларов, что в десятки раз меньше затрат западных конкурентов. Это заставило инвесторов пересмотреть оценку перспектив дорогостоящих ИИ-проектов.

Ключевая особенность DeepSeek — открытый исходный код. В отличие от ChatGPT и Claude, модели DeepSeek распространяются с открытыми весами, что позволяет разработчикам по всему миру изучать алгоритмы, дорабатывать их и использовать в коммерческих проектах. При этом данные для обучения моделей не публикуются, поэтому формально это не полностью открытый код, а модель с открытыми весами.

История создания: от хедж-фонда до мирового лидера

История DeepSeek началась задолго до официального запуска компании. В 2015 году три инженера из Чжэцзянского университета основали High-Flyer — компанию, которая использовала алгоритмы машинного обучения для торговли акциями. К 2021 году все торговые стратегии фонда полностью полагались на ИИ, а саму компанию сравнивали с американской Renaissance Technologies.

В апреле 2023 года High-Flyer объявила о запуске нового проекта, посвящённого исследованиям в области общего искусственного интеллекта (AGI). Проект был отделён от финансового бизнеса и получил название DeepSeek. Возглавил его Лян Вэньфэн, один из сооснователей хедж-фонда. Финансирование полностью обеспечивала High-Flyer, что дало команде уникальную свободу — им не нужно было думать о коммерциализации на ранних этапах.

При найме сотрудников компания отдавала предпочтение способностям, а не опыту. Большинство разработчиков — недавние выпускники университетов или специалисты на раннем этапе карьеры. Такой подход позволил собрать команду, не обременённую устоявшимися подходами к разработке ИИ. Известно, что сотрудники работали по 18 часов в сутки, уделяя сну около четырёх часов, но их труд щедро оплачивался.

Первая модель DeepSeek Coder вышла в ноябре 2023 года и была бесплатной для коммерческого использования. Через несколько недель появилась DeepSeek LLM с 67 миллиардами параметров, которая по производительности приближалась к GPT-4. Однако настоящий прорыв произошёл в мае 2024 года с выходом DeepSeek-V2.

Архитектура и технические инновации: почему DeepSeek такая дешёвая

Главный технический секрет DeepSeek — архитектура Mixture-of-Experts (MoE), которая позволяет активировать только часть параметров модели при обработке каждого запроса. DeepSeek-V3 имеет 685 миллиардов параметров и 256 экспертов, но для каждого токена активируются лишь 8 из них, что составляет около 37 миллиардов параметров. Это радикально снижает вычислительные затраты при сохранении высокой производительности.

Второе важное нововведение — метод Multi-head Latent Attention (MLA), который снижает затраты на обучение примерно на 90%. Этот подход оптимизирует использование памяти и ускоряет обработку данных. Благодаря комбинации этих технологий обучение DeepSeek-V3 обошлось примерно в 5,58 миллиона долларов и заняло около двух месяцев. Для сравнения: обучение сопоставимых моделей западных компаний стоит в десятки раз дороже.

Обучение проводилось на графических процессорах Nvidia H800, которые значительно менее мощны, чем новейшие чипы Blackwell, доступные американским компаниям. Это стало возможным благодаря эффективной оптимизации аппаратного обеспечения и программных алгоритмов. Санкции США, ограничивающие доступ Китая к передовым чипам, фактически подтолкнули китайских разработчиков к поиску инновационных решений при ограниченных ресурсах.

Скорость обработки DeepSeek-V3 достигает 60 токенов в секунду, что в три раза быстрее предыдущей версии. Модель поддерживает контекст до 128 000 токенов, что позволяет анализировать тексты объёмом в несколько сотен страниц. Для сравнения, DeepSeek-V2 имела 236 миллиардов параметров, из которых при выводе активировался 21 миллиард.

Модельный ряд: от DeepSeek Coder до V3.1 и R1

Компания выпустила несколько поколений моделей, каждая из которых решает определённые задачи. DeepSeek Coder, вышедшая в ноябре 2023 года, специализировалась на написании кода и была бесплатной для коммерческого использования. DeepSeek LLM, запущенная в том же месяце, стала первой универсальной моделью компании с 67 миллиардами параметров.

DeepSeek-V2, представленная в мае 2024 года, спровоцировала ценовую войну на китайском рынке ИИ. Её стоимость составляла всего 2 юаня за миллион токенов, что вынудило ByteDance, Tencent, Baidu и Alibaba снизить цены на свои модели. Несмотря на низкую цену, компания отчиталась о прибыли, тогда как конкуренты несли убытки.

DeepSeek-V3, вышедшая в декабре 2024 года, стала флагманской моделью. По результатам тестов она превзошла Llama 3.1 и Qwen 2.5, а также соответствовала уровню GPT-4o и Claude 3.5 Sonnet. В бенчмарке Arena-Hard модель набрала 85,5 балла, а в AlpacaEval 2.0 — 70 баллов, что выше показателей большинства конкурентов.

DeepSeek-R1, выпущенная в январе 2025 года, специализируется на логических рассуждениях. Модель генерирует ответы шаг за шагом, имитируя процесс человеческого мышления. По результатам тестов по математике, химии и программированию она находится на одном уровне с OpenAI o1. В мае 2025 года вышла улучшенная версия R1 с увеличенным до 685 миллиардов количеством параметров.

DeepSeek-V3.1, выпущенная в 2025 году, объединяет функции диалогового общения, логических рассуждений и программирования в гибридной архитектуре. Она способна обрабатывать до 128 000 токенов контекста, что делает её пригодной для анализа больших документов.

Влияние на мировые рынки: обвал акций и переоценка ИИ-инвестиций

27 января 2025 года стало переломным моментом для мирового рынка искусственного интеллекта. Запуск DeepSeek-R1 спровоцировал резкое падение акций технологических компаний. Nvidia потеряла около 600 миллиардов долларов капитализации за один день — это крупнейшее падение в истории американского фондового рынка. Акции ASML Holding упали более чем на 8%, а в Токио падение достигло 8,5%.

Особенно пострадали энергетические компании, которые ранее рассчитывали на рост спроса из-за ИИ-инфраструктуры. Акции Constellation Energy упали на 21%, Siemens Energy — на 20%. Инвесторы пересмотрели свои ожидания: если мощные модели можно создавать за 5,6 миллиона долларов, то гигантские дата-центры и закупки чипов могут оказаться избыточными.

500 самых богатых людей мира потеряли в общей сложности 108 миллиардов долларов из-за распродаж в технологическом секторе. Капитализация криптовалют, связанных с ИИ, сократилась на 22% за сутки. При этом мобильное приложение DeepSeek заняло первое место в App Store в США, ОАЭ, Южной Корее, Японии, Великобритании и Китае, потеснив ChatGPT.

Потрясения продлились недолго, но последствия оказались значительными. Аналитики Huaxi Securities назвали произошедшее переломным моментом, после которого у китайских инвесторов вырос интерес к местным ИИ-компаниям. К 12 февраля 2025 года индекс китайских технологических акций в Гонконге вырос более чем на 20% за месяц. По оценкам Fidelity International, стоимость разработки ведущих моделей ИИ упала примерно на 80% за последние два года, и DeepSeek ускорила эту тенденцию.

Как пользоваться DeepSeek в России: способы доступа и установка

DeepSeek доступна российским пользователям несколькими способами. Самый простой — официальный сайт chat.deepseek.com, где можно зарегистрироваться и пользоваться моделью через веб-интерфейс. Для доступа к API разработчикам необходимо обратиться к документации на api-docs.deepseek.com. VPN для доступа к API не требуется, что упрощает интеграцию в российские проекты.

Для мобильных устройств доступны приложения DeepSeek — AI Assistant для Android и iOS. Приложение можно найти в Google Play и App Store. Для пользователей Android также доступен APK-файл для прямой установки. На компьютерах можно использовать браузерное расширение DeepSeek для Chrome, которое позволяет обращаться к нейросети прямо из браузера.

Существуют также русскоязычные зеркала и агрегаторы, например deepseek-ai.ru, которые предоставляют доступ к моделям DeepSeek V3, V3.2 и R1 на русском языке. Такие сервисы часто предлагают бесплатный доступ без ограничений, а также дополнительные материалы — курсы, промты и обучающие руководства. Однако при использовании сторонних сервисов стоит проявлять осторожность и проверять их надёжность.

Для разработчиков доступна интеграция через API с использованием популярных языков программирования — Python, R и SQL. Модель поддерживает работу с облачными системами, что обеспечивает гибкость при развёртывании. Стоимость API значительно ниже конкурентов: около 0,14 доллара за миллион токенов против 2,50 доллара у ChatGPT.

Практическое применение: что умеет DeepSeek в реальных задачах

DeepSeek демонстрирует высокую эффективность в различных сферах. В бизнесе модель используется для прогнозирования спроса, анализа клиентских отзывов и оптимизации цепочек поставок. Алгоритмы позволяют выявлять скрытые закономерности в больших объёмах данных и принимать обоснованные решения на основе точной информации.

В медицине DeepSeek применяется для диагностики заболеваний, анализа медицинских изображений и прогнозирования результатов лечения. Модель помогает врачам быстрее ставить диагнозы, что улучшает качество обслуживания пациентов. В финансовой сфере нейросеть анализирует риски, выявляет мошеннические операции и прогнозирует динамику рынка.

Для обычных пользователей DeepSeek предлагает широкий набор функций: написание текстов, статей и постов, перевод и анализ документов, структурирование данных, объяснение сложных тем, написание кода и создание сценариев. Модель понимает контекст и длинные запросы, что делает её удобной для работы с русскоязычными текстами.

В промышленности DeepSeek помогает оптимизировать производственные процессы, прогнозировать поломки оборудования и улучшать управление ресурсами. Это снижает затраты и повышает эффективность производства. В IT-сфере модель используется для разработки умных чат-ботов и автоматизации процессов. Важно отметить, что лицензия DeepSeek разрешает коммерческое использование, но запрещает применение модели военными и юристами.

Ограничения и цензура: что нужно знать пользователям

Несмотря на впечатляющие возможности, DeepSeek имеет ряд ограничений, о которых важно знать. Модель разработана в Китае и, вероятно, подвергается цензуре по определённым темам. Пользователи сообщают, что нейросеть не отвечает на вопросы о Тайване и не пишет о Си Цзиньпине. При этом не все деликатные для Китая темы подвержены цензуре — ограничения избирательны.

В мае 2024 года, после выхода DeepSeek-V2, сеть заполнили жалобы на предвзятость модели. Это вызвало дискуссии о том, насколько свободно китайские ИИ-модели могут обсуждать политические темы. Независимые наблюдатели отмечают, что DeepSeek и другие китайские компании имеют преимущество на внутреннем рынке, так как доступ к ChatGPT и ряду других западных моделей заблокирован Великим китайским файерволом.

Ещё одно ограничение — лицензионные условия. Модель распространяется с лицензией DeepSeek, которая гарантирует безвозмездную лицензию для авторских прав и патентов, но запрещает использование военным и юристам. Это важное ограничение для компаний, работающих в этих сферах.

Технические ограничения также существуют. Несмотря на заявленную высокую производительность, независимые проверки продолжаются. Некоторые эксперты отмечают, что в тестах AIME 2024 года OpenAI o1 находил решения быстрее, чем DeepSeek R1-Lite-Preview. Кроме того, модель может испытывать проблемы с вычислительной эффективностью и масштабируемостью при работе с очень большими объёмами данных.

Сравнение с конкурентами: DeepSeek против ChatGPT, Claude и Llama

DeepSeek-V3 демонстрирует результаты, сопоставимые с ведущими мировыми моделями. В бенчмарке Arena-Hard модель набрала 85,5 балла, опередив GPT-4o (80,4) и Llama 3.1 405B (69,3), но уступив Claude Sonnet 3.5 (85,2). В AlpacaEval 2.0 DeepSeek-V3 показала 70 баллов, значительно опередив всех конкурентов, включая Claude Sonnet 3.5 (52,0) и GPT-4o (51,1).

Главное преимущество DeepSeek — цена. Стоимость API составляет около 0,14 доллара за миллион токенов, что в 18 раз дешевле ChatGPT (2,50 доллара). Это делает модель особенно привлекательной для стартапов и компаний с ограниченным бюджетом. При этом качество ответов на русском языке, по отзывам пользователей, не уступает ChatGPT, а в некоторых задачах даже превосходит его.

Марк Цукерберг публично признал превосходство DeepSeek-V3 над Llama-4 от Meta в различных тестах. Это заявление стало символическим: китайская модель, созданная за 5,6 миллиона долларов, обошла разработку компании, планирующей инвестировать 60-65 миллиардов долларов в ИИ-инфраструктуру в 2025 году.

Ян Лекун, известный учёный в области ИИ, связал успех DeepSeek с открытым исходным кодом и инновационным подходом к разработке. Он не считает это признаком доминирования Китая, но отмечает, что открытость модели ускоряет развитие всей отрасли. Эксперты сходятся во мнении, что DeepSeek показала: важные разработки могут быть бюджетными, в отличие от мегадолларовых вложений западных лабораторий.

Перспективы развития: что дальше и стоит ли инвестировать

DeepSeek продолжает активно развиваться. Компания заявляет о планах по созданию общего искусственного интеллекта (AGI) и работает над улучшением модельной архитектуры. В ближайших планах — поддержка новых типов данных, расширенные инструменты визуализации аналитики и улучшенные механизмы автоматического обучения.

В мае 2025 года вышла улучшенная версия DeepSeek-R1 с увеличенным количеством параметров, а также облегчённая версия DeepSeek-R1-0528-Qwen3-8B, созданная методом дистилляции. Это показывает, что компания работает над оптимизацией моделей для разных сценариев использования — от мощных серверных решений до лёгких мобильных приложений.

Для инвесторов появление DeepSeek стало сигналом о переоценке рынка ИИ. Стоимость разработки ведущих моделей упала примерно на 80% за последние два года, и эта тенденция, вероятно, продолжится. Аналитики отмечают, что доступность ИИ будет расширяться, что поддержит спрос на чипы и инфраструктуру в долгосрочной перспективе, несмотря на краткосрочные падения.

Однако остаются вопросы о способности DeepSeek создать AGI и о том, насколько устойчива её бизнес-модель. Компания занимается исследованиями и не заявляет подробных планов коммерциализации. При этом она отчитывается о прибыли, что отличает её от конкурентов, несущих убытки. Открытость моделей может ускорить развитие всей отрасли, но также создаёт риски для самой компании в виде конкуренции со стороны разработчиков, использующих её наработки.

Вопросы и ответы

Что такое DeepSeek и кто её создал?

DeepSeek — это китайская компания и семейство больших языковых моделей, разработанных в Ханчжоу. Компания основана в 2023 году как подразделение хедж-фонда High-Flyer, который с 2015 года использовал машинное обучение для торговли акциями. Основатель — Лян Вэньфэн. Финансирование полностью обеспечивает High-Flyer, что позволяет команде сосредоточиться на исследованиях, а не на коммерциализации.

Почему DeepSeek вызвала обвал акций технологических компаний?

В январе 2025 года DeepSeek выпустила модель R1, обучение которой обошлось примерно в 5,6 миллиона долларов — в десятки раз дешевле аналогов западных компаний. Это заставило инвесторов пересмотреть оценку дорогостоящих ИИ-проектов. Nvidia потеряла около 600 миллиардов долларов капитализации за один день, Nasdaq 100 снизился на 3%, а 500 самых богатых людей мира потеряли 108 миллиардов долларов.

Как пользоваться DeepSeek в России?

Есть несколько способов: официальный сайт chat.deepseek.com с регистрацией, мобильные приложения для Android и iOS, браузерное расширение для Chrome, а также русскоязычные зеркала вроде deepseek-ai.ru. Для разработчиков доступен API через api-docs.deepseek.com. VPN для доступа к API не требуется. Стоимость API — около 0,14 доллара за миллион токенов.

Чем DeepSeek отличается от ChatGPT?

Главные отличия: открытый исходный код (модель с открытыми весами), значительно более низкая стоимость API (в 18 раз дешевле ChatGPT), архитектура Mixture-of-Experts с 685 миллиардами параметров, из которых активируются только 37 миллиардов. По качеству ответов на русском языке DeepSeek не уступает ChatGPT, а в некоторых задачах превосходит его. При этом модель имеет ограничения по политическим темам из-за китайской цензуры.

Какие модели DeepSeek существуют и чем они отличаются?

Основные модели: DeepSeek Coder (для написания кода), DeepSeek LLM (первая универсальная модель), DeepSeek-V2 (дешёвая модель, вызвавшая ценовую войну в Китае), DeepSeek-V3 (флагманская модель, сопоставимая с GPT-4o), DeepSeek-R1 (модель для логических рассуждений) и DeepSeek-V3.1 (гибридная модель с контекстом до 128 000 токенов). Каждая следующая версия улучшает производительность и снижает стоимость.

Бесплатна ли DeepSeek и можно ли использовать её в коммерческих целях?

Да, DeepSeek доступна бесплатно через веб-интерфейс и мобильные приложения. Модели распространяются с открытыми весами по лицензии DeepSeek, которая разрешает коммерческое использование. Однако есть ограничения: модель нельзя использовать военным и юристам. Для коммерческого использования через API взимается плата, но она значительно ниже, чем у конкурентов.

Какие ограничения есть у DeepSeek?

Основные ограничения: цензура по политическим темам (модель не отвечает на вопросы о Тайване и Си Цзиньпине), запрет на использование военным и юристами по лицензии, возможные проблемы с вычислительной эффективностью при работе с очень большими объёмами данных. Также независимые проверки производительности продолжаются, и некоторые эксперты отмечают, что в отдельных тестах OpenAI o1 работает быстрее.