Что такое DeepSeek и почему о ней заговорил весь мир
DeepSeek — это семейство больших языковых моделей, разработанных одноимённой китайской компанией из Ханчжоу. Проект появился в 2023 году как исследовательское подразделение хедж-фонда High-Flyer, который с 2015 года использовал машинное обучение для торговли на фондовом рынке. Основатель компании Лян Вэньфэн ещё в 2021 году закупил около 10 000 графических процессоров Nvidia, которые первоначально использовались для анализа рыночных данных, а затем были переориентированы на задачи искусственного интеллекта.
Мировую известность DeepSeek получила в январе 2025 года после выхода модели R1. Её запуск вызвал резкое падение акций технологических компаний по всему миру: Nvidia потеряла около 600 миллиардов долларов капитализации за один день, а индекс Nasdaq 100 снизился на 3%. Причина такого эффекта — заявление разработчиков о том, что модель была обучена всего за 5,6 миллиона долларов, что в десятки раз меньше затрат западных конкурентов. Это заставило инвесторов пересмотреть оценку перспектив дорогостоящих ИИ-проектов.
Ключевая особенность DeepSeek — открытый исходный код. В отличие от ChatGPT и Claude, модели DeepSeek распространяются с открытыми весами, что позволяет разработчикам по всему миру изучать алгоритмы, дорабатывать их и использовать в коммерческих проектах. При этом данные для обучения моделей не публикуются, поэтому формально это не полностью открытый код, а модель с открытыми весами.
История создания: от хедж-фонда до мирового лидера
История DeepSeek началась задолго до официального запуска компании. В 2015 году три инженера из Чжэцзянского университета основали High-Flyer — компанию, которая использовала алгоритмы машинного обучения для торговли акциями. К 2021 году все торговые стратегии фонда полностью полагались на ИИ, а саму компанию сравнивали с американской Renaissance Technologies.
В апреле 2023 года High-Flyer объявила о запуске нового проекта, посвящённого исследованиям в области общего искусственного интеллекта (AGI). Проект был отделён от финансового бизнеса и получил название DeepSeek. Возглавил его Лян Вэньфэн, один из сооснователей хедж-фонда. Финансирование полностью обеспечивала High-Flyer, что дало команде уникальную свободу — им не нужно было думать о коммерциализации на ранних этапах.
При найме сотрудников компания отдавала предпочтение способностям, а не опыту. Большинство разработчиков — недавние выпускники университетов или специалисты на раннем этапе карьеры. Такой подход позволил собрать команду, не обременённую устоявшимися подходами к разработке ИИ. Известно, что сотрудники работали по 18 часов в сутки, уделяя сну около четырёх часов, но их труд щедро оплачивался.
Первая модель DeepSeek Coder вышла в ноябре 2023 года и была бесплатной для коммерческого использования. Через несколько недель появилась DeepSeek LLM с 67 миллиардами параметров, которая по производительности приближалась к GPT-4. Однако настоящий прорыв произошёл в мае 2024 года с выходом DeepSeek-V2.
Архитектура и технические инновации: почему DeepSeek такая дешёвая
Главный технический секрет DeepSeek — архитектура Mixture-of-Experts (MoE), которая позволяет активировать только часть параметров модели при обработке каждого запроса. DeepSeek-V3 имеет 685 миллиардов параметров и 256 экспертов, но для каждого токена активируются лишь 8 из них, что составляет около 37 миллиардов параметров. Это радикально снижает вычислительные затраты при сохранении высокой производительности.
Второе важное нововведение — метод Multi-head Latent Attention (MLA), который снижает затраты на обучение примерно на 90%. Этот подход оптимизирует использование памяти и ускоряет обработку данных. Благодаря комбинации этих технологий обучение DeepSeek-V3 обошлось примерно в 5,58 миллиона долларов и заняло около двух месяцев. Для сравнения: обучение сопоставимых моделей западных компаний стоит в десятки раз дороже.
Обучение проводилось на графических процессорах Nvidia H800, которые значительно менее мощны, чем новейшие чипы Blackwell, доступные американским компаниям. Это стало возможным благодаря эффективной оптимизации аппаратного обеспечения и программных алгоритмов. Санкции США, ограничивающие доступ Китая к передовым чипам, фактически подтолкнули китайских разработчиков к поиску инновационных решений при ограниченных ресурсах.
Скорость обработки DeepSeek-V3 достигает 60 токенов в секунду, что в три раза быстрее предыдущей версии. Модель поддерживает контекст до 128 000 токенов, что позволяет анализировать тексты объёмом в несколько сотен страниц. Для сравнения, DeepSeek-V2 имела 236 миллиардов параметров, из которых при выводе активировался 21 миллиард.
Модельный ряд: от DeepSeek Coder до V3.1 и R1
Компания выпустила несколько поколений моделей, каждая из которых решает определённые задачи. DeepSeek Coder, вышедшая в ноябре 2023 года, специализировалась на написании кода и была бесплатной для коммерческого использования. DeepSeek LLM, запущенная в том же месяце, стала первой универсальной моделью компании с 67 миллиардами параметров.
DeepSeek-V2, представленная в мае 2024 года, спровоцировала ценовую войну на китайском рынке ИИ. Её стоимость составляла всего 2 юаня за миллион токенов, что вынудило ByteDance, Tencent, Baidu и Alibaba снизить цены на свои модели. Несмотря на низкую цену, компания отчиталась о прибыли, тогда как конкуренты несли убытки.
DeepSeek-V3, вышедшая в декабре 2024 года, стала флагманской моделью. По результатам тестов она превзошла Llama 3.1 и Qwen 2.5, а также соответствовала уровню GPT-4o и Claude 3.5 Sonnet. В бенчмарке Arena-Hard модель набрала 85,5 балла, а в AlpacaEval 2.0 — 70 баллов, что выше показателей большинства конкурентов.
DeepSeek-R1, выпущенная в январе 2025 года, специализируется на логических рассуждениях. Модель генерирует ответы шаг за шагом, имитируя процесс человеческого мышления. По результатам тестов по математике, химии и программированию она находится на одном уровне с OpenAI o1. В мае 2025 года вышла улучшенная версия R1 с увеличенным до 685 миллиардов количеством параметров.
DeepSeek-V3.1, выпущенная в 2025 году, объединяет функции диалогового общения, логических рассуждений и программирования в гибридной архитектуре. Она способна обрабатывать до 128 000 токенов контекста, что делает её пригодной для анализа больших документов.
Влияние на мировые рынки: обвал акций и переоценка ИИ-инвестиций
27 января 2025 года стало переломным моментом для мирового рынка искусственного интеллекта. Запуск DeepSeek-R1 спровоцировал резкое падение акций технологических компаний. Nvidia потеряла около 600 миллиардов долларов капитализации за один день — это крупнейшее падение в истории американского фондового рынка. Акции ASML Holding упали более чем на 8%, а в Токио падение достигло 8,5%.
Особенно пострадали энергетические компании, которые ранее рассчитывали на рост спроса из-за ИИ-инфраструктуры. Акции Constellation Energy упали на 21%, Siemens Energy — на 20%. Инвесторы пересмотрели свои ожидания: если мощные модели можно создавать за 5,6 миллиона долларов, то гигантские дата-центры и закупки чипов могут оказаться избыточными.
500 самых богатых людей мира потеряли в общей сложности 108 миллиардов долларов из-за распродаж в технологическом секторе. Капитализация криптовалют, связанных с ИИ, сократилась на 22% за сутки. При этом мобильное приложение DeepSeek заняло первое место в App Store в США, ОАЭ, Южной Корее, Японии, Великобритании и Китае, потеснив ChatGPT.
Потрясения продлились недолго, но последствия оказались значительными. Аналитики Huaxi Securities назвали произошедшее переломным моментом, после которого у китайских инвесторов вырос интерес к местным ИИ-компаниям. К 12 февраля 2025 года индекс китайских технологических акций в Гонконге вырос более чем на 20% за месяц. По оценкам Fidelity International, стоимость разработки ведущих моделей ИИ упала примерно на 80% за последние два года, и DeepSeek ускорила эту тенденцию.
Как пользоваться DeepSeek в России: способы доступа и установка
DeepSeek доступна российским пользователям несколькими способами. Самый простой — официальный сайт chat.deepseek.com, где можно зарегистрироваться и пользоваться моделью через веб-интерфейс. Для доступа к API разработчикам необходимо обратиться к документации на api-docs.deepseek.com. VPN для доступа к API не требуется, что упрощает интеграцию в российские проекты.
Для мобильных устройств доступны приложения DeepSeek — AI Assistant для Android и iOS. Приложение можно найти в Google Play и App Store. Для пользователей Android также доступен APK-файл для прямой установки. На компьютерах можно использовать браузерное расширение DeepSeek для Chrome, которое позволяет обращаться к нейросети прямо из браузера.
Существуют также русскоязычные зеркала и агрегаторы, например deepseek-ai.ru, которые предоставляют доступ к моделям DeepSeek V3, V3.2 и R1 на русском языке. Такие сервисы часто предлагают бесплатный доступ без ограничений, а также дополнительные материалы — курсы, промты и обучающие руководства. Однако при использовании сторонних сервисов стоит проявлять осторожность и проверять их надёжность.
Для разработчиков доступна интеграция через API с использованием популярных языков программирования — Python, R и SQL. Модель поддерживает работу с облачными системами, что обеспечивает гибкость при развёртывании. Стоимость API значительно ниже конкурентов: около 0,14 доллара за миллион токенов против 2,50 доллара у ChatGPT.
Практическое применение: что умеет DeepSeek в реальных задачах
DeepSeek демонстрирует высокую эффективность в различных сферах. В бизнесе модель используется для прогнозирования спроса, анализа клиентских отзывов и оптимизации цепочек поставок. Алгоритмы позволяют выявлять скрытые закономерности в больших объёмах данных и принимать обоснованные решения на основе точной информации.
В медицине DeepSeek применяется для диагностики заболеваний, анализа медицинских изображений и прогнозирования результатов лечения. Модель помогает врачам быстрее ставить диагнозы, что улучшает качество обслуживания пациентов. В финансовой сфере нейросеть анализирует риски, выявляет мошеннические операции и прогнозирует динамику рынка.
Для обычных пользователей DeepSeek предлагает широкий набор функций: написание текстов, статей и постов, перевод и анализ документов, структурирование данных, объяснение сложных тем, написание кода и создание сценариев. Модель понимает контекст и длинные запросы, что делает её удобной для работы с русскоязычными текстами.
В промышленности DeepSeek помогает оптимизировать производственные процессы, прогнозировать поломки оборудования и улучшать управление ресурсами. Это снижает затраты и повышает эффективность производства. В IT-сфере модель используется для разработки умных чат-ботов и автоматизации процессов. Важно отметить, что лицензия DeepSeek разрешает коммерческое использование, но запрещает применение модели военными и юристами.
Ограничения и цензура: что нужно знать пользователям
Несмотря на впечатляющие возможности, DeepSeek имеет ряд ограничений, о которых важно знать. Модель разработана в Китае и, вероятно, подвергается цензуре по определённым темам. Пользователи сообщают, что нейросеть не отвечает на вопросы о Тайване и не пишет о Си Цзиньпине. При этом не все деликатные для Китая темы подвержены цензуре — ограничения избирательны.
В мае 2024 года, после выхода DeepSeek-V2, сеть заполнили жалобы на предвзятость модели. Это вызвало дискуссии о том, насколько свободно китайские ИИ-модели могут обсуждать политические темы. Независимые наблюдатели отмечают, что DeepSeek и другие китайские компании имеют преимущество на внутреннем рынке, так как доступ к ChatGPT и ряду других западных моделей заблокирован Великим китайским файерволом.
Ещё одно ограничение — лицензионные условия. Модель распространяется с лицензией DeepSeek, которая гарантирует безвозмездную лицензию для авторских прав и патентов, но запрещает использование военным и юристам. Это важное ограничение для компаний, работающих в этих сферах.
Технические ограничения также существуют. Несмотря на заявленную высокую производительность, независимые проверки продолжаются. Некоторые эксперты отмечают, что в тестах AIME 2024 года OpenAI o1 находил решения быстрее, чем DeepSeek R1-Lite-Preview. Кроме того, модель может испытывать проблемы с вычислительной эффективностью и масштабируемостью при работе с очень большими объёмами данных.
Сравнение с конкурентами: DeepSeek против ChatGPT, Claude и Llama
DeepSeek-V3 демонстрирует результаты, сопоставимые с ведущими мировыми моделями. В бенчмарке Arena-Hard модель набрала 85,5 балла, опередив GPT-4o (80,4) и Llama 3.1 405B (69,3), но уступив Claude Sonnet 3.5 (85,2). В AlpacaEval 2.0 DeepSeek-V3 показала 70 баллов, значительно опередив всех конкурентов, включая Claude Sonnet 3.5 (52,0) и GPT-4o (51,1).
Главное преимущество DeepSeek — цена. Стоимость API составляет около 0,14 доллара за миллион токенов, что в 18 раз дешевле ChatGPT (2,50 доллара). Это делает модель особенно привлекательной для стартапов и компаний с ограниченным бюджетом. При этом качество ответов на русском языке, по отзывам пользователей, не уступает ChatGPT, а в некоторых задачах даже превосходит его.
Марк Цукерберг публично признал превосходство DeepSeek-V3 над Llama-4 от Meta в различных тестах. Это заявление стало символическим: китайская модель, созданная за 5,6 миллиона долларов, обошла разработку компании, планирующей инвестировать 60-65 миллиардов долларов в ИИ-инфраструктуру в 2025 году.
Ян Лекун, известный учёный в области ИИ, связал успех DeepSeek с открытым исходным кодом и инновационным подходом к разработке. Он не считает это признаком доминирования Китая, но отмечает, что открытость модели ускоряет развитие всей отрасли. Эксперты сходятся во мнении, что DeepSeek показала: важные разработки могут быть бюджетными, в отличие от мегадолларовых вложений западных лабораторий.
Перспективы развития: что дальше и стоит ли инвестировать
DeepSeek продолжает активно развиваться. Компания заявляет о планах по созданию общего искусственного интеллекта (AGI) и работает над улучшением модельной архитектуры. В ближайших планах — поддержка новых типов данных, расширенные инструменты визуализации аналитики и улучшенные механизмы автоматического обучения.
В мае 2025 года вышла улучшенная версия DeepSeek-R1 с увеличенным количеством параметров, а также облегчённая версия DeepSeek-R1-0528-Qwen3-8B, созданная методом дистилляции. Это показывает, что компания работает над оптимизацией моделей для разных сценариев использования — от мощных серверных решений до лёгких мобильных приложений.
Для инвесторов появление DeepSeek стало сигналом о переоценке рынка ИИ. Стоимость разработки ведущих моделей упала примерно на 80% за последние два года, и эта тенденция, вероятно, продолжится. Аналитики отмечают, что доступность ИИ будет расширяться, что поддержит спрос на чипы и инфраструктуру в долгосрочной перспективе, несмотря на краткосрочные падения.
Однако остаются вопросы о способности DeepSeek создать AGI и о том, насколько устойчива её бизнес-модель. Компания занимается исследованиями и не заявляет подробных планов коммерциализации. При этом она отчитывается о прибыли, что отличает её от конкурентов, несущих убытки. Открытость моделей может ускорить развитие всей отрасли, но также создаёт риски для самой компании в виде конкуренции со стороны разработчиков, использующих её наработки.
Вопросы и ответы
Что такое DeepSeek и кто её создал?
DeepSeek — это китайская компания и семейство больших языковых моделей, разработанных в Ханчжоу. Компания основана в 2023 году как подразделение хедж-фонда High-Flyer, который с 2015 года использовал машинное обучение для торговли акциями. Основатель — Лян Вэньфэн. Финансирование полностью обеспечивает High-Flyer, что позволяет команде сосредоточиться на исследованиях, а не на коммерциализации.
Почему DeepSeek вызвала обвал акций технологических компаний?
В январе 2025 года DeepSeek выпустила модель R1, обучение которой обошлось примерно в 5,6 миллиона долларов — в десятки раз дешевле аналогов западных компаний. Это заставило инвесторов пересмотреть оценку дорогостоящих ИИ-проектов. Nvidia потеряла около 600 миллиардов долларов капитализации за один день, Nasdaq 100 снизился на 3%, а 500 самых богатых людей мира потеряли 108 миллиардов долларов.
Как пользоваться DeepSeek в России?
Есть несколько способов: официальный сайт chat.deepseek.com с регистрацией, мобильные приложения для Android и iOS, браузерное расширение для Chrome, а также русскоязычные зеркала вроде deepseek-ai.ru. Для разработчиков доступен API через api-docs.deepseek.com. VPN для доступа к API не требуется. Стоимость API — около 0,14 доллара за миллион токенов.
Чем DeepSeek отличается от ChatGPT?
Главные отличия: открытый исходный код (модель с открытыми весами), значительно более низкая стоимость API (в 18 раз дешевле ChatGPT), архитектура Mixture-of-Experts с 685 миллиардами параметров, из которых активируются только 37 миллиардов. По качеству ответов на русском языке DeepSeek не уступает ChatGPT, а в некоторых задачах превосходит его. При этом модель имеет ограничения по политическим темам из-за китайской цензуры.
Какие модели DeepSeek существуют и чем они отличаются?
Основные модели: DeepSeek Coder (для написания кода), DeepSeek LLM (первая универсальная модель), DeepSeek-V2 (дешёвая модель, вызвавшая ценовую войну в Китае), DeepSeek-V3 (флагманская модель, сопоставимая с GPT-4o), DeepSeek-R1 (модель для логических рассуждений) и DeepSeek-V3.1 (гибридная модель с контекстом до 128 000 токенов). Каждая следующая версия улучшает производительность и снижает стоимость.
Бесплатна ли DeepSeek и можно ли использовать её в коммерческих целях?
Да, DeepSeek доступна бесплатно через веб-интерфейс и мобильные приложения. Модели распространяются с открытыми весами по лицензии DeepSeek, которая разрешает коммерческое использование. Однако есть ограничения: модель нельзя использовать военным и юристам. Для коммерческого использования через API взимается плата, но она значительно ниже, чем у конкурентов.
Какие ограничения есть у DeepSeek?
Основные ограничения: цензура по политическим темам (модель не отвечает на вопросы о Тайване и Си Цзиньпине), запрет на использование военным и юристами по лицензии, возможные проблемы с вычислительной эффективностью при работе с очень большими объёмами данных. Также независимые проверки производительности продолжаются, и некоторые эксперты отмечают, что в отдельных тестах OpenAI o1 работает быстрее.