DeepSeek V4.1 Flash в 2026: тест из России, цены в рублях и стоит ли уходить с V4 Pro
10 сентября 2026 DeepSeek выпустил V4.1 Flash: 763 млрд параметров, из которых на каждом токене работают 8-16 млрд, встроенное зрение и выход втрое дешевле V4 Pro. Разбираем, что поменялось для пользователя из России, сколько теперь стоит миллион токенов в рублях и как ловить половинный тариф по московскому времени. Обновлено 21 сентября: DeepSeek отменил перевод V4 Pro на Flash, а непиковый тариф теперь целиком накрывает выходные и китайские праздники.
22 мин чтения
10 сентября 2026 DeepSeek выложил V4.1 Flash - модель на 763 млрд параметров, которая по устройству не похожа ни на что из предыдущих версий. Вместо привычного трансформера внутри стоит связка из энкодера и декодера, зрение встроено на уровне обучения, а на обработку каждого токена уходит от 8 до 16 млрд параметров вместо всех 763. Итог: модель обходит прежний флагман V4 Pro на тестах и стоит в три с лишним раза дешевле.
Дальше по порядку: что конкретно поменялось в архитектуре и зачем это знать обычному пользователю, сколько стоит миллион токенов в рублях, как открыть модель из России и где V4.1 Flash честно проваливается.
DeepSeek V4.1 Flash вышел 10 сентября 2026 под лицензией MIT, веса открыты. Контекст 1 млн токенов, зрение встроенное, цена выхода 51 ₽ за миллион токенов в непиковые часы против 167 ₽ у V4 Pro. Обещанный перевод V4 Pro на Flash с 14 сентября DeepSeek отменил: старый флагман работает дальше по своему прайсу. Чат в приложении и на сайте остался бесплатным. Главная засада новой модели - многословность: она пишет на четверть длиннее конкурентов, и часть экономии на цене съедается объёмом ответа.
Словарик: пять терминов, без которых дальше не разобраться
- Активные параметры - сколько весов модели реально участвует в расчёте одного токена. Чем меньше активных при том же общем размере, тем дешевле и быстрее ответ.
- Энкодер-декодер - схема из двух частей: одна читает и сжимает вопрос, вторая пишет ответ. Раньше в чат-моделях обе работы делала одна и та же стопка слоёв.
- KV-кэш - память модели о том, что уже было в диалоге. Она физически занимает место в видеопамяти, и от её размера зависит, влезет ли длинный контекст в твоё железо.
- Пиковые часы - время, когда серверы DeepSeek загружены и токены стоят вдвое дороже. Привязаны к рабочему дню в Китае.
- Reasoning effort - ползунок глубины рассуждений. У V4.1 Flash это шкала от 1 до 100 вместо трёх кнопок, как было раньше.
Что произошло 10 сентября
Формально это обновление внутри четвёртой версии. Фактически DeepSeek переписал модель изнутри, и специалисты это заметили сразу.
Её стоило назвать DeepSeek V5.
- Себастьян Рашка, автор книг по машинному обучению, в разборе релиза
Три вещи, которые изменились по существу.
Модель стала видеть. Раньше у DeepSeek был отдельный экспериментальный V4 Flash Vision Exp, где зрение прикрутили поверх готовой текстовой модели. В V4.1 Flash картинки и текст учились вместе с самого начала обучения. Разница заметна на скриншотах интерфейсов и таблицах: модель перестала терять мелкие подписи. Как это использовать на бытовых задачах, мы разбирали в гайде DeepSeek читает скриншоты и чеки.
Контекст остался 1 млн токенов, максимальный ответ - 384 тысячи токенов. Это примерно 700 тысяч слов на вход и 270 тысяч на выход, то есть в одно окно влезает несколько книг.
Цена рухнула. Выход подешевел с 1,98 доллара за миллион токенов до 0,60 в непиковые часы. При этом баллы на тестах выросли.
Названия моделей в API переименовали. Теперь актуальный идентификатор - deepseek-flash, а старые deepseek-v4-flash и deepseek-v4-flash-vision-exp объявлены устаревшими и переадресуются на него. Если у тебя в скриптах прибито старое имя, оно пока работает, но лучше поправить.
Зачем модели 763 млрд параметров, если работают 16
Это главная идея релиза, и объяснить её стоит на пальцах.
Обычная большая модель прогоняет каждое слово через всю свою массу весов. Модель на 700 млрд параметров думает семьюстами миллиардами над любым вопросом, включая «сколько будет два плюс два». Отсюда счета за электричество и цены на токены.
DeepSeek пошёл другим путём. Внутри V4.1 Flash сорок слоёв, разбитых пополам: двадцать слоёв энкодера читают твой вопрос, двадцать слоёв декодера пишут ответ. На чтении включаются 8 млрд параметров, на письме - 16 млрд. Остальные 750 млрд лежат тихо и подключаются только когда нужны: в модели 384 специализированных блока-эксперта, и на каждый токен активируются шесть.
Вторая половина экономии - память. Разработчики сжали KV-кэш до 890 байт на токен, вчетверо меньше, чем у предыдущего V4 Flash. Для сервера это означает вчетверо меньше видеопамяти под тот же диалог, для тебя - что миллион токенов контекста перестал быть маркетинговой цифрой и стал рабочим режимом.
Как было в V4 Pro
- Одна стопка слоёв на чтение и на письмо
- Зрение отдельной экспериментальной сборкой
- KV-кэш распухает на длинном контексте
- Выход 1,98 доллара за 1 млн токенов
Что в V4.1 Flash
- Энкодер на 8 млрд отдельно от декодера на 16 млрд
- Картинки и текст учились вместе с нуля
- 890 байт на токен, вчетверо меньше памяти
- Выход 0,60 доллара за 1 млн токенов
Бенчмарки: дешёвая модель обогнала дорогую
Обычно новая дешёвая версия догоняет старший флагман с отставанием. Здесь получилось наоборот.
| Тест | V4.1 Flash | V4 Pro | Что меряет |
|---|---|---|---|
| DeepSWE v1.1 | 74,2 | 62,7 | правки в многофайловом проекте |
| Terminal-Bench 2.1 | 91,4 | 88,7 | работу командами в терминале |
| HumanEval | 90,6 | 88,0 | написание функций по описанию |
| GSM8K | 90,8 | 90,4 | школьную математику текстом |
Самый показательный разрыв - DeepSWE: 74,2 против 62,7. Этот тест меряет способность довести до конца цепочку действий в чужом коде, и именно там прошлые версии DeepSeek разваливались на третьем шаге. Мы фиксировали прошлый скачок по этому тесту в разборе DeepSeek V4 Pro из России - там модель подросла с 12,8 до 62,7, теперь добавилось ещё двенадцать баллов.
По скорости выдачи Artificial Analysis намерил около 210 токенов в секунду при времени до первого токена 1,13 секунды. Для сравнения: человек читает вслух примерно 3 токена в секунду, так что текст появляется быстрее, чем ты успеваешь его проглядеть.
Разобраться в бенчмарках полезно, но деньги приносит умение работать с моделью руками. Пройди мини-курс «Claude за вечер»: от установки до первых результатов на твоих задачах.
Пройти мини-курс →V4 Pro остаётся: перевод на Flash отменили
В релизе 10 сентября DeepSeek предупредил, что с 14 сентября запросы к модели deepseek-v4-pro поедут на V4.1 Flash. Мы писали об этом как о снятии старого флагмана. Решение отменили.
В том же changelog компания дописала, что по просьбам пользователей продолжает обслуживать V4 Pro в API отдельной моделью, а порядок списания денег остаётся прежним. На странице тарифов V4 Pro и сейчас стоит собственной колонкой со своим прайсом и своим лимитом одновременных запросов.
Обновлено 21 сентября 2026. Проверено по официальной странице тарифов и changelog DeepSeek: deepseek-v4-pro жив, цены на него не менялись. На покой отправлены другие имена - deepseek-v4-flash и deepseek-v4-flash-vision-exp. Запросы с этими идентификаторами продолжают приниматься, но обслуживает их V4.1 Flash и считает по своему прайсу.
Что это значит на практике. Если у тебя в скриптах прибит deepseek-v4-pro, менять ничего не нужно и счёт не изменится. Если прибито одно из двух старых имён Flash, проверь качество ответов: модель под капотом уже другая, она пишет длиннее и структурирует ответ иначе, поэтому тесты, настроенные на прежний формат вывода, могут начать падать без единой правки в твоём коде.
Вывод на будущее: объявленную дату отключения модели у DeepSeek перепроверяй в день X. Планировать переезд заранее по одному пресс-релизу рискованно. За последний месяц компания дважды меняла планы по линейке уже после официального анонса.
Цены на API в рублях
Курс ЦБ РФ на 12 сентября 2026 - 84,2569 ₽ за доллар. Считаем по нему.
| Что считаем | Flash, непик | Flash, пик | V4 Pro, непик | V4 Pro, пик |
|---|---|---|---|---|
| Вход, попадание в кэш | 0,25 ₽ | 0,51 ₽ | 1,85 ₽ | 3,71 ₽ |
| Вход, промах мимо кэша | 13 ₽ | 25 ₽ | 56 ₽ | 111 ₽ |
| Выход | 51 ₽ | 101 ₽ | 167 ₽ | 334 ₽ |
Цены указаны за 1 млн токенов. Разрыв по выходу - в 3,3 раза, по входу - в 4,4 раза, по кэшу - в 7,3 раза.
Кэш здесь важнее всего остального, и вот почему. Когда агент работает с твоим проектом, он раз за разом отправляет модели один и тот же кусок кода в начале каждого запроса. Эта часть считается по льготному тарифу, и при цене 0,25 ₽ за миллион она перестаёт быть заметной строкой в счёте вообще. Именно за счёт кэша длинные сессии с кодом у DeepSeek выходят дешевле, чем у кого угодно.
Artificial Analysis прогнал модель через свой набор задач и посчитал стоимость прохождения: около 0,27 доллара, то есть 23 ₽ за полный цикл тестов.
DeepSeek V4.1 Flash за прогон набора задач Artificial Analysis
модели класса GPT-5.6 в том же замере
Gemini 3 Flash, тот же набор задач
Когда DeepSeek стоит вдвое дешевле: расписание по Москве
Цена токена у DeepSeek зависит от часа суток. Это единственный рычаг экономии, который работает без единой правки в промптах и без смены модели: тот же запрос, та же модель, тот же результат, счёт вдвое меньше.
Пиковый тариф действует с 01:00 до 04:00 и с 06:00 до 10:00 UTC, по будням. Москва живёт на три часа впереди, поэтому дорогие часы приходятся на 04:00-07:00 и 09:00-13:00 по Москве.
| Время по Москве | Тариф | Что тут происходит |
|---|---|---|
| 00:00-04:00 | половинный | глубокая ночь, самое дешёвое окно |
| 04:00-07:00 | полный | Китай выходит на работу |
| 07:00-09:00 | половинный | окно на два часа между пиками |
| 09:00-13:00 | полный | твоё рабочее утро совпало с китайским днём |
| 13:00-00:00 | половинный | обед, вечер, ночь |
Смотри, какая картина получается. Дорогой тариф включается всего 35 часов в неделю из 168. Остальные 133 часа, а это 79% времени, DeepSeek и так отдаёт токены за половину цены. Задача сводится к тому, чтобы не влезать в два коротких окна.
Формула: ставь объёмную рутину на запуск после 13:00 по Москве и плати ровно половину за тот же результат. Всё, что попало в 04:00-07:00 и 09:00-13:00 по будням, стоит двойных денег.
Выходные и китайские праздники идут целиком по низкой цене
Окно скидок у DeepSeek расширялось постепенно. Сначала дешёвыми были только ночные часы. Потом выходные целиком ушли в непиковый тариф. Теперь туда же отправились государственные праздники Китая: в праздничный день пиковый тариф не включается вообще, даже если день выпал на будний.
Для сентября и октября 2026 это выглядит так:
| Дата | День недели | Тариф весь день |
|---|---|---|
| 25 сентября | пятница | половинный, Праздник середины осени |
| 1-2 октября | четверг, пятница | половинный, День образования КНР |
| 3-4 октября | суббота, воскресенье | половинный, выходные |
| 5-7 октября | понедельник, вторник, среда | половинный, продолжение каникул |
Шесть рабочих дней подряд, в которые дорогой тариф просто не включается. Если у тебя лежит отложенная пачка задач на API - разметка базы, перевод каталога, прогон тестов по большому репозиторию - первая неделя октября это лучшее окно года, чтобы её закрыть.
Китайские каникулы часто удлиняют переносом рабочих дней, и перенесённые дни для расчёта DeepSeek остаются непиковыми. Перед крупным прогоном есть смысл заглянуть в китайский производственный календарь: там иногда находится лишний дешёвый день, которого нет ни в одном пресс-релизе.
Сколько это в деньгах
Посчитаем на живом сценарии. Агентная сессия с кодом: 8 млн входных токенов попадают в кэш, 1,5 млн идут мимо кэша, 400 тысяч уходит на ответы. Курс ЦБ РФ 84,20 ₽ за доллар на 19 сентября 2026.
| Модель | Непиковый час | Пиковый час | Переплата |
|---|---|---|---|
| V4.1 Flash, одна сессия | 41 ₽ | 82 ₽ | 41 ₽ |
| V4.1 Flash, 20 сессий в месяц | 823 ₽ | 1647 ₽ | 824 ₽ |
| V4 Pro, одна сессия | 165 ₽ | 330 ₽ | 165 ₽ |
| V4 Pro, 20 сессий в месяц | 3297 ₽ | 6594 ₽ | 3297 ₽ |
Двадцать сессий в месяц это примерно час работы с агентом каждый будний день. На Flash перенос таких задач на вторую половину дня экономит около 800 ₽ в месяц, на V4 Pro больше трёх тысяч.
Перенос задач на дешёвые часы имеет смысл только для того, что можно запустить и оставить: пакетная обработка, ночные прогоны, отложенная очередь. Живой диалог с агентом в рабочее время ради половинного тарифа переносить не стоит - сэкономишь сотню рублей и потеряешь рабочий день. Считай, сколько стоит твой час.
Тариф определяется временем, когда запрос пришёл на сервер. Момент, когда ты нажал кнопку у себя, роли не играет. Длинная задача, стартовавшая в 12:55 по Москве, продолжит считаться по пиковой цене на тех запросах, которые уйдут до 13:00, и по половинной на всех последующих. Для аккуратного счёта ставь запуск с запасом в десять минут после границы.
Если считаешь бюджет сразу по всем нейросетям, пригодится разбор сколько токенов даёт подписка за 20 долларов: там та же арифметика применительно к ChatGPT Plus, Claude Pro и Gemini.
Работает ли DeepSeek из России в сентябре 2026
Честный ответ прежний: зависит от провайдера. Прямой сайт chat.deepseek.com у части российских абонентов открывается нормально, у части соединение обрывается на этапе установки шифрованного канала. Единого «работает» или «не работает» по стране нет.
Проверка занимает минуту: открой chat.deepseek.com сначала с мобильного интернета, потом с домашнего Wi-Fi. Если хотя бы один канал грузит сайт, дальше можно ничего не делать - чат бесплатный целиком, регистрация проходит через аккаунт Google без номера телефона.
Путь 1: проверить прямой доступ ≈ 2 мин
- Открыть chat.deepseek.com с мобильного и с домашнего интернета
- Вход через аккаунт Google, номер телефона не нужен
- Карта не нужна, чат бесплатный целиком
- Если грузится, это самый дешёвый способ, он же лучший
Путь 2: свой компьютер ≈ 40 мин
- Веса открыты под MIT, качать с Hugging Face
- Ни VPN, ни карты, ни аккаунта, данные никуда не уходят
- Нужна серьёзная видеокарта или много быстрой памяти
- Подходит тем, у кого чувствительные документы
Путь 3: VPN на оригинальный сайт ≈ 15 мин
- Нужен стабильный зарубежный IP, который не прыгает
- Взамен получаешь оригинал: загрузку файлов, картинки, все режимы
- Регистрацию проходить сразу под VPN, не переключаясь
- Держи запасной сервер, один узел рано или поздно отвалится
Для третьего пути понадобится рабочий VPN с зарубежным IP. Адрес, который прыгает между странами во время регистрации, отдаёт свежий аккаунт на блокировку, так что соединение должно держаться стабильно хотя бы первые десять минут.
Пошаговый разбор регистрации, включая классическую беду с кодом подтверждения, который не приходит на почту, у нас лежит отдельно: DeepSeek: как пользоваться бесплатно из России.
Серверы DeepSeek стоят в Китае, и правила хранения данных там свои. Паспортные данные, рабочие договоры, коммерческие цифры компании и переписку с клиентами в чат не грузи. Для таких задач бери либо российский сервис с локальным хранением, либо локальную модель на своей машине.
Как платить за API из России
Платформа для разработчиков открывается из России стабильнее, чем чат, и регистрация через Gmail проходит. Упирается всё в одно: российские карты Visa и Mastercard на пополнение баланса не идут.
Через OpenRouter. Единый шлюз, который держит DeepSeek вместе с сотней других моделей и берёт небольшой процент сверху. Один ключ открывает всё сразу, баланс пополняется криптой. Разбор настройки у нас в гайде OpenRouter: как пользоваться.
Через сервис-посредник. Переводишь рубли, тебе оплачивают зарубежной картой, комиссия обычно 13-20 процентов. Удобно, когда нужен именно прямой аккаунт DeepSeek с официальным прайсом. Один из рабочих вариантов - сервис оплаты подписок (реферальная ссылка: тебе тот же прайс, мне небольшой процент).
Через российский агрегатор за рубли. Самый простой путь без VPN и валютной карты, оплата обычной картой РФ или через СБП. Минус в наценке и в задержке: свежие версии моделей приезжают туда через неделю-две после релиза. Все способы платить зарубежным сервисам мы собрали в гайде как оплатить нейросети из России.
Готовые аккаунты DeepSeek с балансом, которые продают в Telegram, брать не стоит. Продавец сохраняет доступ к почте восстановления и забирает аккаунт обратно ровно тогда, когда ты залил туда рабочий проект. Экономия в пару тысяч рублей стоит потерянной сессии.
Запуск на своём компьютере: цифры, которые впечатляют
Асимметричная архитектура дала побочный эффект, ради которого модель стоит скачать даже тем, кто не собирался.
Раз на каждом токене работают 8-16 млрд параметров, железу не нужно держать наготове все 763 млрд. Энтузиасты отчитались о 300 с лишним токенах в секунду на сборке из четырёх профессиональных видеокарт RTX в полной точности, причём пиковое потребление оперативной памяти держалось ниже 32 ГБ. Отдельно сообщали об успешном запуске на ноутбуке с M5 Max, где веса подгружались прямо с SSD, и о работе с подкачкой с NVMe-диска на 200 ГБ.
Для российского читателя это отдельная развилка: локальная модель не требует ни VPN, ни зарубежной карты, ни доверия к чужим серверам. Цена вопроса - железо и время на настройку. Какими инструментами это поднимать, разбирали в материале локальный ИИ: LM Studio, Ollama и llama.cpp.
Формула: DeepSeek снял цену перестройкой модели, безо всяких скидок. Меньше активных параметров - меньше счёт за токены и ниже порог по железу, причём одновременно. Поэтому дешёвая версия обогнала дорогую вместо того, чтобы её догонять.
Где V4.1 Flash проваливается
Хвалебных обзоров модели в сети уже много, поэтому проговорим то, о чём пишут реже.
Она очень многословная. В замерах Artificial Analysis модель тратила в среднем около 89 тысяч выходных токенов на задачу - на четверть с лишним больше конкурентов, а на отдельных типах задач до полутора раз больше. Каждый выходной токен ты оплачиваешь, так что часть выигрыша по прайсу возвращается обратно объёмом текста. Считать надо цену за решённую задачу, цифра за миллион токенов тут обманывает.
Внутренние оценки выше внешних. Наблюдатели, которые давно следят за релизами DeepSeek, отмечают разрыв между собственными бенчмарками компании и поведением модели на живых задачах: встречаются странные провалы там, где по баллам их быть не должно. Формально это называют хрупкостью, на практике выглядит как уверенно неправильный ответ на простом вопросе после безупречного разбора сложного.
Многоагентные сборки портят результат. DeepSeek предлагает запускать несколько экземпляров модели командой. Работает это только на проектах с ясной модульной структурой: если границы между частями проекта размыты, агенты начинают переписывать друг за другом и качество падает ниже одиночного запуска.
Ещё одна цифра для контекста: по общему индексу интеллекта Artificial Analysis V4.1 Flash набирает 40 баллов и занимает шестое место из 113 моделей. Среди моделей с открытыми весами это первая строчка, среди всех - крепкая середина верхней группы. Флагманы OpenAI и Anthropic по сырому интеллекту всё ещё впереди, разрыв виден на длинных многошаговых задачах.
Три промпта, чтобы проверить модель на своих задачах
Бенчмарки меряют чужие задачи. Свои проверяются за десять минут - вот три сценария, в которых разница между версиями видна сразу.
Первый - длинный контекст. Загрузи в чат документ на сотню страниц и попроси поискать противоречия вместо пересказа:
Ты редактор-педант. Прочитай документ целиком и найди места, где условия противоречат друг другу: разные суммы для одного и того же, разные сроки, ссылки на пункты, которых нет. Выдай таблицу: пункт 1 | пункт 2 | в чём противоречие | какая формулировка вероятнее верная. Ничего не придумывай. Если противоречий нет, так и напиши одной строкой.
Второй - зрение. Скинь скриншот таблицы или интерфейса и проверь, теряет ли модель мелкие подписи:
На изображении скриншот таблицы. Перенеси её в markdown построчно, сохранив все числа и подписи колонок ровно как на картинке. Там, где символ распознаётся неуверенно, ставь пометку (?) сразу после него. Не дописывай строки, которых на картинке нет.
Третий - контроль многословности. Тот самый случай, где новая модель по умолчанию заливает текстом:
Ответь на вопрос ниже максимум в 120 словах. Без вступления, без списка «что мы рассмотрели», без финального резюме. Если для точного ответа не хватает данных, первой строкой напиши, чего именно не хватает, и на этом остановись. Вопрос: [впиши свой]
Третий промпт стоит держать под рукой постоянно. На V4.1 Flash он экономит ощутимую долю выходных токенов, а значит и денег.
Что у тебя теперь есть
- Понимание, почему 763 млрд параметров не означают 763 млрд в счёте: на токене работают 8 и 16 млрд.
- Таблица цен в рублях по курсу ЦБ на 12 сентября 2026 и знание, что кэш стоит 0,25 ₽ за миллион.
- Таблица пиковых часов по Москве и правило ставить объёмные задачи после 13:00.
- Календарь дней, когда дорогой тариф не включается совсем: выходные, 25 сентября и вся первая неделя октября.
- Расчёт экономии в рублях на месяц вперёд для Flash и для V4 Pro.
- Знание, что перевод V4 Pro на Flash отменён и менять идентификатор в скриптах не нужно.
- Три пути доступа из России с честной оценкой каждого, включая запуск на своей машине.
- Три промпта, чтобы проверить прирост на собственных документах вместо чтения чужих бенчмарков.
Главный сюжет релиза не в баллах. DeepSeek показал, что удешевление даёт другая схема расчёта, и урезать модель для этого необязательно. Результат выложен под MIT. Для пользователя из России это означает простую вещь: бесплатный чат стал умнее, а порог входа в локальный запуск опустился до уровня хорошей домашней сборки.
По материалам latent.space: AINews: DeepSeek v4.1-Flash, 763B-P8B-D16B novel causal Encoder-Decoder architecture with vision. Цены и даты сверены с официальной страницей тарифов DeepSeek и карточкой модели на Hugging Face, курс доллара по данным ЦБ РФ на 12 сентября 2026.
Обновление от 21 сентября 2026 подготовлено по материалам Хабра: DeepSeek дешевеет ночью: цена токенов теперь зависит от часа суток. Расписание пиковых часов, состав непиковых дней и отмену перевода V4 Pro на Flash перепроверили по официальной странице тарифов и changelog DeepSeek, расчёты в рублях по курсу ЦБ РФ 84,20 ₽ за доллар на 19 сентября 2026.
Частые вопросы
Что нового в DeepSeek V4.1 Flash от 10 сентября 2026?
Новая архитектура Causal Encoder-Decoder: 763 млрд параметров всего, но на разборе вопроса работают только 8 млрд, а на написании ответа 16 млрд. Зрение встроено в модель с самого обучения, а не прикручено сбоку. Контекст 1 млн токенов, лицензия MIT, веса открыты на Hugging Face. По бенчмаркам модель обходит прежний флагман V4 Pro и при этом стоит втрое дешевле.
Сколько стоит DeepSeek V4.1 Flash в рублях?
По курсу ЦБ 84,26 ₽ за доллар на 12 сентября 2026: миллион выходных токенов обойдётся в 51 ₽ в непиковые часы и 101 ₽ в пиковые. Миллион входных токенов мимо кэша - 13 ₽ и 25 ₽. Попадание в кэш стоит копейки: 0,25 ₽ за миллион. У V4 Pro выход стоит 167 ₽ и 334 ₽, то есть Flash дешевле в 3,3 раза. Пиковый тариф включается только 35 часов в неделю, остальные 133 часа идут по половинной цене.
Работает ли DeepSeek из России без VPN в сентябре 2026?
Зависит от провайдера, единого ответа по стране нет. У части абонентов chat.deepseek.com открывается напрямую, у части соединение обрывается. Проверка занимает минуту: открой сайт с мобильного интернета и с домашнего Wi-Fi. Если не грузится ни там, ни там, остаются два пути: VPN с зарубежным IP или российский агрегатор нейросетей за рубли.
V4 Pro отключили 14 сентября?
Нет, DeepSeek отменил это решение. В сентябре компания объявила, что по просьбам пользователей продолжает обслуживать deepseek-v4-pro как отдельную модель со своим прайсом, порядок списания не меняется. Так что модель на месте и стоит прежних денег. Выбор между ней и Flash остаётся за тобой, и по агентским тестам Flash впереди при цене втрое ниже.
Можно ли запустить DeepSeek V4.1 Flash на своём компьютере?
Да, веса открыты под MIT и лежат на Hugging Face. За счёт того, что на каждом токене работает 8-16 млрд параметров вместо всех 763, модель выдаёт больше 300 токенов в секунду на сборке из четырёх профессиональных видеокарт RTX, а пиковое потребление оперативной памяти держится ниже 32 ГБ. Энтузиасты запускали её с подгрузкой весов с NVMe-диска на 200 ГБ.