# Локальная AI-инфраструктура: оборудование, модели, облака и экономика

## Резюме решения

Исследование зафиксировано на 2026-09-09. Факты ниже привязаны к прямым страницам производителей, модельным карточкам и опубликованным прайс-листам. Ценовые коридоры сборок и TCO — расчётные допущения, а не коммерческие предложения. Любая покупка требует повторной проверки цены, комплектности, гарантии, происхождения устройства и применимых условий обработки данных.

Главный вывод: **AMD Ryzen™ AI Max+ 395** — правильное название процессора; **Strix Halo** — прежнее кодовое имя платформы, а не название отдельного продукта. У процессора до 128 ГБ распаянной LPDDR5x-8000 на 256-битной шине, а Radeon 8060S может адресовать до 96 ГБ в типовой конфигурации Framework под Windows и больше под Linux. Это большая общая память, но не эквивалент 96 ГБ дискретной HBM/GDDR по пропускной способности, задержкам и зрелости CUDA-экосистемы.[^1][^2]

В пределах **500 000 ₽ на само вычислительное оборудование** практически разумны три маршрута:

1. **Пилотный мини-ПК, 64 ГБ:** Ryzen AI Max+ 395, ориентир 220–260 тыс. ₽ после доставки и SSD. Он подходит для Qwen3.5 9B/27B, Qwen3.5-35B-A3B в Q4 при ограниченном контексте, OCR, embeddings, Whisper, SDXL и лёгкого FLUX. Это расчётный ориентир из официальной цены Framework $1 959, а не российская оферта.[^3]
2. **Основная memory-heavy on-prem станция, 128 ГБ:** Ryzen AI Max+ 395, ориентир 380–430 тыс. ₽ после логистического резерва и накопителя. Её преимущество — модели, которым тесно в 24/32 ГБ VRAM; недостаток — существенно более слабая и менее универсальная GPU-экосистема, чем CUDA. Официальная DIY-конфигурация 128 ГБ стоит $3 449 без российского НДС, импорта и SSD.[^3]
3. **Производительная NVIDIA-конфигурация:** в новом российском ритейле RTX 5090 и RTX 4090 уже сами по себе превышают лимит 500 тыс. ₽ по наблюдаемым ценам. Новый RTX 3090 24 ГБ позволяет удержать полную станцию около лимита, но имеет слабое соотношение цена/производительность. RTX 4090 или две RTX 3090 укладываются только при проверенной покупке б/у/параллельного импорта; такие цены в этом исследовании не подтверждены Авито.[^7][^8][^9]

В базовом расчёте полная первоначальная инвестиция с UPS, NAS/дисками, монтажом и интеграцией составляет **628 тыс. ₽**, то есть больше лимита на вычислительное оборудование. Условный срок возврата денежных затрат — **20,6 месяца**, ROI по денежному потоку: **−41,6% на 12 месяцах, +16,8% на 24 и +75,2% на 36**. Это не обещание: результат возникает только если ежемесячно действительно замещаются 120 GPU-часов/API на 43,5 тыс. ₽ и реализуется 21,1 тыс. ₽ ценности экономии труда. Консервативный сценарий не окупается вообще, а окупаемость менее года появляется только в агрессивном сценарии с высокой загрузкой и подтверждённой экономией труда.

Рекомендуемая последовательность — **API/облачный пилот → замер фактической нагрузки 6–8 недель → выбор железа**. Если основной дефицит — память для больших локальных LLM и конфиденциальность, предпочтительнее 128-ГБ Strix Halo. Если приоритет — генерация изображений, VLM, обучение/LoRA, высокая совместимость и предсказуемая эксплуатация, предпочтительнее NVIDIA, но закупку RTX 4090/двух RTX 3090 нужно считать условной до проверки конкретного предложения.

## Границы доказательств

| Маркер | Что означает |
|---|---|
| **Факт** | Данные напрямую опубликованы производителем, провайдером, модельной карточкой или магазином и снабжены ссылкой. |
| **Расчёт** | Арифметика на основе фактов или явно выделенных входов; значения можно изменить в `data/roi-model.xlsx`. |
| **Допущение** | Рабочая оценка при отсутствии оферты или данных конкретной организации; не является рыночной гарантией. |
| **Рекомендация** | Аналитическое решение, которое зависит от нагрузочного теста, закупочной проверки и правовой оценки. |

Ограничение Авито существенно: в среде выполнения отсутствовал MCP `browser-avito-main`. Доступен был только общий браузер Paseo, который по директиве использовать для Авито запрещено. Прямой HTTP, поисковое индексирование и scraping Авито не применялись. Поэтому в отчёте и листе `Avito` **нет объявлений**, а цены б/у обозначены только как неподтверждённые целевые допущения, не как найденные предложения.

## AMD Ryzen AI Max+ 395 и unified memory

### Проверенные характеристики

**Факт.** Официальное наименование — **AMD Ryzen™ AI Max+ 395**. Он относится к Ryzen AI Max 300 Series; AMD указывает former codename **Strix Halo**, 16 ядер Zen 5 / 32 потока, частоту до 5,1 ГГц, 55 Вт default TDP и диапазон cTDP 45–120 Вт. Встроенная графика — Radeon 8060S с 40 graphics cores, NPU — до 50 TOPS, совокупный показатель — до 126 TOPS.[^1]

**Факт.** Системная память — 256-битная LPDDR5x, максимум 128 ГБ, скорость до LPDDR5x-8000.[^1] В Framework Desktop память распаяна и не обновляется; для 128-ГБ варианта Framework документирует до 96 ГБ «graphics addressable memory» под Windows и больше под Linux. На той же странице заявлен запуск gpt-oss-120b MXFP4 со скоростью 38 токенов/с для конкретной конфигурации и программного окружения; этот результат нельзя переносить на другие модели и длины контекста без теста.[^2]

**Расчёт.** Теоретическая пропускная способность общей памяти:

`8 000 MT/s × 256 бит ÷ 8 = 256 000 MB/s ≈ 256 GB/s`.

Это примерно порядок характеристики, а не гарантированная прикладная скорость. Для сравнения, дискретные RTX используют выделенную GDDR6X/GDDR7 и заметно более широкую/быструю подсистему памяти. Модель, помещающаяся в unified memory, ещё не обязательно будет работать с приемлемой задержкой.

### Что unified memory даёт и чего не даёт

**Факты и ограничения.** CPU и iGPU обращаются к одному физическому пулу памяти, поэтому не требуется отдельная копия весов в дискретную VRAM. Это позволяет загрузить Q4-модели на 35B, 70B и некоторые MoE/120B-классы, которые не помещаются на одной RTX 4090 24 ГБ или RTX 5090 32 ГБ. Однако часть RAM остаётся ОС и приложениям; размер GPU-addressable пула зависит от BIOS/ОС/драйвера. Память распаяна, ECC в массовых мини-ПК обычно не заявлена, а отказ платы означает простой всей системы.[^1][^2]

**Практическое ограничение.** CUDA остаётся наиболее совместимым путём для vLLM, SGLang, TensorRT, Diffusers, обучения и большинства готовых инструкций. У AMD есть ROCm и поддержка Radeon/Ryzen, но совместимость зависит от точной версии ОС, драйвера, PyTorch и модели. Перед закупкой нужен smoke-test именно целевого образа ОС и контейнеров, а не только демонстрация llama.cpp/LM Studio.[^32][^33][^34]

**Рекомендация.** Считать Strix Halo устройством «много памяти, умеренная вычислительная скорость», а не дешёвой заменой серверной NVIDIA 80 ГБ. Он особенно силён для интерактивного локального инференса одного пользователя, документов/RAG и больших квантизованных моделей; слабее для высокой конкурентности, тяжёлого обучения и производственного GPU-сервинга.

## Сопоставление конфигураций до 500 000 ₽

| Класс | Конфигурация | Расчётная цена оборудования | Память для моделей | Сильная сторона | Критическое ограничение |
|---|---:|---:|---:|---|---|
| Пилотный мини-ПК | Framework/аналог, Ryzen AI Max+ 395, 64 ГБ LPDDR5x, 1–2 ТБ SSD | 220–260 тыс. ₽ | до 48 ГБ graphics-addressable у Framework | тихий пилот, компактность, низкая мощность | распаянная память; 48 ГБ уже ограничивают крупные LLM |
| Основная memory-heavy станция | Ryzen AI Max+ 395, 128 ГБ, 2 ТБ NVMe | 380–430 тыс. ₽ | до 96 ГБ под Windows, больше под Linux | 70B/122B MoE Q4, приватные документы | ROCm/драйверы и меньшая скорость памяти |
| Новая NVIDIA около лимита | Ryzen 9/Core i9, 128 ГБ RAM, RTX 3090 24 ГБ, 2 ТБ NVMe | 460–500 тыс. ₽ | 24 ГБ GDDR6X | CUDA, зрелые инструменты, NVLink у 3090 | старая карта, 350 Вт, 24 ГБ; наблюдаемая новая цена завышена |
| Условная high-throughput NVIDIA | RTX 4090 24 ГБ или 2×RTX 3090, 128 ГБ RAM | 450–500 тыс. ₽ только б/у/импорт | 24 ГБ или 48 ГБ агрегатно | скорость, Diffusers, LoRA, vLLM | цена не подтверждена; две карты не образуют автоматически единую VRAM |
| RTX 5090 new | 32 ГБ GDDR7 + платформа | от 760 тыс. ₽ по наблюдаемой цене | 32 ГБ | максимальная скорость consumer CUDA | не укладывается в лимит уже на уровне GPU |

**Факты.** RTX 3090 имеет 24 ГБ GDDR6X и 350 Вт graphics card power; RTX 4090 — 24 ГБ GDDR6X и 450 Вт total graphics power; RTX 5090 — 32 ГБ GDDR7 и 575 Вт, рекомендуемая мощность системы 1000 Вт.[^4][^5][^6] Эти значения важны для UPS, электропроводки, охлаждения и уровня шума.

**Допущения цены.** Для Framework использован официальный USD-прайс и курс ЦБ РФ 86,4730 ₽/$ на 2026-09-09, затем добавлен сценарный резерв на логистику/импорт и SSD.[^3][^18] Для RTX 4090 и двух RTX 3090 внутри лимита использованы не рыночные факты, а целевые закупочные коридоры: 280 тыс. ₽ за RTX 4090 или 120 тыс. ₽ за одну RTX 3090. Пока нет проверенного объявления, эти варианты нельзя включать в утверждённый бюджет.

**Рекомендация.** При запрете на облачную передачу документов и необходимости запускать 70B/122B-класс — 128-ГБ Strix Halo. При 24–35B-моделях, OCR/VLM/FLUX и нескольких пользователях — NVIDIA. Для двух RTX 3090 закладывать tensor parallel/model split; 48 ГБ — сумма физической памяти, но приложение обязано уметь распределять модель между GPU.

## Наблюдаемое предложение и Авито

### Публичный российский ритейл

**Факт, снимок страницы на 2026-09-09.** В Regard отображались:

| Товар | Цена | Нормализация | Вывод |
|---|---:|---:|---|
| Palit RTX 5090 GameRock OC 32 ГБ | 566 510 ₽ | 17 703 ₽/ГБ VRAM | одна карта уже выше лимита |
| ASUS RTX 5090 ROG Astral OC 32 ГБ | 745 090 ₽ | 23 284 ₽/ГБ VRAM | премиальная наценка, вне бюджета |
| AFOX RTX 4090 24 ГБ | 602 190 ₽ | 25 091 ₽/ГБ VRAM | вне бюджета до остальной станции |
| AFOX RTX 3090 24 ГБ | 277 930 ₽ | 11 580 ₽/ГБ VRAM | полная новая станция возможна около 470–500 тыс. ₽ |
| ASUS ProArt PX13, Max+ 395, 64 ГБ, 1 ТБ | 390 710 ₽ | 6 105 ₽/ГБ RAM | ноутбук, не сервер; память только 64 ГБ |
| ASUS ROG Flow Z13, Max+ 395, 32 ГБ, 1 ТБ | 255 470 ₽ | 7 983 ₽/ГБ RAM | не решает задачу большой памяти |

Цены взяты со страниц поиска магазина и могут измениться без уведомления.[^7][^8][^9] Продукты AFOX 4090 «48 ГБ», найденные в том же каталоге, не использованы в расчётах: 48 ГБ не является стандартной спецификацией NVIDIA RTX 4090, поэтому требуется отдельная проверка модификации, драйверов и гарантии.

### Авито

**Ограничение доказательств.** Собрать требуемые минимум 10 объявлений не удалось по технической причине: выделенный MCP `browser-avito-main` отсутствовал в доступных инструментах. Общий Paseo browser, Playwright, Firecrawl, прямой HTTP и поисковые сниппеты для Авито сознательно не использовались. В `data/roi-model.xlsx` лист `Avito` содержит схему требуемых полей и запись об ограничении, но не содержит вымышленных URL, цен, городов или характеристик.

Если выделенный браузер появится в следующей сессии, минимальная процедура — создать собственную вкладку, запросить отдельно `Ryzen AI Max+ 395`, `RTX 3090 workstation`, `RTX 4090 workstation`, `RTX 5090 workstation`, зафиксировать URL и дату доступа, исключить объявления без проверяемой комплектности и нормализовать цену как ₽/ГБ доступной памяти и ₽ за полную готовую систему. Контакты с продавцами не требуются.

**Риски б/у GPU:** скрытый майнинг/длительная работа на высокой температуре, деградация вентиляторов и термопрокладок, ремонт/реболл, подмена BIOS, отсутствие чека и гарантии, несоответствие фото серийному номеру, слабый БП в готовой станции, переходники 12VHPWR, недостаток PCIe-линий и расстояния между картами. Для мини-ПК добавляются распаянная RAM, ограниченная ремонтопригодность, импортная клавиатура/вилка, таможенные документы и невозможность вернуть устройство российскому юрлицу.

## Локальные модели и стеки

Размеры памяти ниже — **инженерные диапазоны для инференса**, а не паспортные требования. Правило оценки весов: FP16 ≈ 2 байта на параметр, INT8 ≈ 1, Q4 ≈ 0,5; затем требуется запас на runtime, vision encoder, KV-cache, контекст и параллельные запросы. Длинный контекст может занять больше памяти, чем сами веса.

| Сценарий | Модель/стек | Практический минимум | Квантизация и ограничения | Лицензия/оговорка |
|---|---|---:|---|---|
| Базовый помощник, русский/код | Qwen3.5-9B | 8–12 ГБ VRAM/RAM | Q4/Q5; 262k заявленного контекста не означает, что такой KV-cache поместится на 12 ГБ | Apache-2.0; карточка модели[^19] |
| Качественный локальный помощник | Qwen3.5-27B | 18–24 ГБ | Q4; на 24 ГБ ограничивать контекст и concurrency | Apache-2.0; 27B dense[^19] |
| Быстрый MoE | Qwen3.5-35B-A3B | 20–28 ГБ | все 35B весов должны быть загружены, хотя активно около 3B; 24 ГБ — тесный режим | Apache-2.0; 35B total/3B active[^20] |
| Большая memory-heavy модель | Qwen3.5-122B-A10B | 70–90 ГБ | Q4; 122B весов загружаются, 10B активны; подходит 96-ГБ unified при коротком/среднем контексте | Apache-2.0; 122B total/10B active[^21] |
| Reasoning fallback | DeepSeek-R1-Distill-Qwen-32B | 20–26 ГБ | Q4; на 24 ГБ нужен короткий контекст/offload | MIT для весов репозитория, базовый Qwen-2.5 Apache-2.0[^25] |
| Большая dense LLM | Llama 3.3 70B Instruct | 42–55 ГБ | Q4/Q5; одна 24/32-ГБ карта не подходит без offload/split | Llama 3.3 Community License, gated; не Apache/MIT[^26] |
| VLM и OCR документов | Qwen3-VL-8B-Instruct | 10–16 ГБ | Q4/FP8; память растёт с числом/размером изображений и видео | Apache-2.0; карточка заявляет расширенный OCR[^22] |
| Специализированный OCR | PaddleOCR-VL-0.9B | 3–6 ГБ | FP16/INT8; сложные таблицы и формулы требуют проверки качества | Apache-2.0; 109 языков заявлены автором[^28] |
| Embeddings | Qwen3-Embedding-0.6B или BGE-M3 | 1–4 ГБ | FP16/INT8; хранение векторов отдельно в pgvector/Qdrant | Apache-2.0 / MIT[^23] |
| Reranker | Qwen3-Reranker-0.6B или BGE-reranker-v2-m3 | 2–6 ГБ | батчи влияют на память и задержку | Apache-2.0[^24] |
| Speech-to-text | Whisper large-v3-turbo | 4–8 ГБ | FP16/INT8; качество неоднородно по языкам/акцентам, возможны повторы | MIT; ограничения описаны в карточке[^27] |
| Генерация изображений | FLUX.1-schnell | 16–24 ГБ, либо RAM offload | FP8/Q8/Q4-сборки; скорость и совместимость зависят от backend | Apache-2.0, доступ к весам gated/auto[^29] |
| Генерация изображений, качество | FLUX.1-dev | 20–32 ГБ | quant/offload; медленнее, чем schnell | специальная FLUX.1-dev Non-Commercial License — коммерческое использование результата/модели проверять отдельно[^30] |
| Генерация изображений, лёгкий baseline | SDXL Base 1.0 | 8–12 ГБ | FP16, attention slicing/offload; слабее новых FLUX по части задач | CreativeML Open RAIL++-M с use-based restrictions[^31] |

### Рекомендуемый программный контур

**LLM runtime.** Для простого пилота — llama.cpp/llama-server или Ollama; для NVIDIA-сервера с параллельными запросами — vLLM/SGLang. Для AMD начинать с проверенного llama.cpp/ROCm-образа, затем пробовать vLLM только на версии, где конкретный Radeon 8060S явно поддержан. Не строить SLA на экспериментальной комбинации драйверов.[^32][^33][^34]

**RAG.** `Docling/PaddleOCR → очистка/чанкинг → Qwen3-Embedding или BGE-M3 → pgvector/Qdrant → Qwen3-Reranker → Qwen3.5`. Embeddings и reranker можно держать постоянно, а крупную LLM загружать по требованию. Для документов с персональными данными локальный контур снижает передачу наружу, но сам по себе не обеспечивает соответствие требованиям: нужны модель угроз, доступы, журналы, сроки хранения и резервные копии.[^23][^24][^28][^35]

**Речь.** faster-whisper/Whisper large-v3-turbo; для потоковой работы ограничивать число одновременных дорожек и хранение аудио. Транскрипт остаётся недостоверным источником для юридически значимых решений без проверки человеком.[^27]

**Графика.** ComfyUI/Diffusers с SDXL или FLUX. NVIDIA предпочтительнее из-за CUDA и более широкого набора оптимизаций. Strix Halo способен запускать часть пайплайнов через ROCm/DirectML/llama.cpp-совместимые сборки, но скорость и поддержка узлов нужно подтвердить тестом.

**Документы, презентации, сайты.** Docling/Pandoc/LibreOffice для извлечения и конвертации, `python-docx`, `openpyxl`, PptxGenJS для детерминированных файлов, Playwright для рендеринга/визуальной проверки сайтов. LLM должна генерировать структуру и данные, а не бинарный файл напрямую. LibreOffice и PptxGenJS имеют собственные лицензии; шаблоны, шрифты, изображения и бренд-материалы требуют отдельного права использования.[^35][^36][^37]

**Интерфейс и доступ.** Open WebUI или тонкий внутренний UI перед API runtime; reverse proxy, SSO, лимиты, аудит и изоляция коллекций RAG. Не публиковать Ollama/vLLM напрямую в интернет.[^38]

## Российские облака, GPU/VPS и зарубежные варианты

### Опубликованные тарифы

| Провайдер | Ресурс | Публичный тариф на 2026-09-09 | Нормализовано | Ограничения |
|---|---|---:|---:|---|
| VK Cloud | L4 24 ГБ, 16 CPU/72 ГБ RAM | 1,65 ₽/мин; 71 456 ₽/30 дней | 99 ₽/ч | минимум 1 час; три плана; egress/диски отдельно |
| VK Cloud | L40S 48 ГБ, 16 CPU/112 ГБ RAM | 4,02 ₽/мин; 173 479 ₽/30 дней | 241,2 ₽/ч | локализация в ЦОД провайдера; проверить квоту |
| VK Cloud | A100 80 ГБ, 32 CPU/192 ГБ RAM | 5,59 ₽/мин; 241 662 ₽/30 дней | 335,4 ₽/ч | цена с НДС на странице; storage/network отдельно |
| Cloud.ru | V100 | от 240 ₽/ч | 240 ₽/ч | конкретная RAM/CPU зависит от предложения |
| Cloud.ru | A100 | от 4,5 ₽/мин | 270 ₽/ч | PAYG; фактическая конфигурация и квота уточняются |
| Cloud.ru | H100 | от 9,5 ₽/мин | 570 ₽/ч | дорогой burst; выделенный 8×H100 от 5,355 млн ₽/мес. |
| Runpod | RTX 3090 24 ГБ | $0,50/ч | 43,24 ₽/ч по курсу ЦБ | USD, зарубежный контрагент, storage/egress и доступность отдельно |
| Runpod | RTX 4090 24 ГБ | $0,74/ч | 63,99 ₽/ч | тот же риск; Community/Secure Cloud отличаются |
| Runpod | RTX 5090 32 ГБ | $0,99/ч | 85,61 ₽/ч | цена/наличие динамичны |
| Runpod | A100 80 ГБ | $1,59/ч | 137,49 ₽/ч | требуется зарубежная оплата; данные уходят за пределы РФ |
| Runpod | H100 PCIe 80 ГБ | $2,89/ч | 249,90 ₽/ч | квота, регион, санкционный и валютный риск |

VK Cloud публикует поминутные и 30-дневные цены с НДС в прайс-листе.[^11][^12] Cloud.ru публикует сравнительную таблицу форматов и стартовые цены.[^10] Runpod показывает тарифы за GPU-час; пересчёт выполнен по курсу ЦБ РФ 86,4730 ₽/$ и не включает комиссию платежа, налоговые последствия и валютный спред.[^15][^18]

### Варианты без сопоставимой публичной фиксированной цены

**Selectel.** Доступны выделенные GPU-серверы A100, A2, RTX A5000/A4000/A2000, RTX 4090 и другие; для готовых серверов заявлен запуск от двух минут, для кастомных — 1–5 дней, включены 1 Гбит/с безлимитно или 300 ТБ/мес., IPv4, DDoS-защита и поддержка. Сопоставимая цена конкретной GPU-конфигурации на статической странице не опубликована, поэтому в TCO она не подставлена.[^13]

**Yandex Cloud.** Документация подтверждает посекундную тарификацию GPU-VM, отдельную оплату дисков, публичного IP и исходящего трафика; входящий и внутренний трафик не тарифицируется, первые 100 ГБ исходящего трафика в месяц бесплатны. Таблица GPU-цен динамически не была доступна в читаемом снимке, поэтому цифра не придумана.[^14]

**Vast.ai.** Это рыночная площадка с динамической ценой, посекундной тарификацией и различными уровнями надёжности; фиксированной цены конкретной карты без живого листинга нет. Она годится для неперсональных batch-задач и воспроизводимых контейнеров, но не должна считаться эквивалентом российского SLA/договора.[^16]

### OpenRouter/API-пилот

OpenRouter API на дату доступа отдавал текущие цены в JSON. Примеры за 1 млн токенов: Qwen3.5-9B — $0,10 input / $0,15 output; Qwen3.5-35B-A3B — $0,3125 / $1,25; DeepSeek V3.2 — $0,269 / $0,40; Gemini 2.5 Flash — $0,30 / $2,50; Claude Sonnet 4.6 — $3 / $15.[^17] Это цены маршрутизатора, они могут меняться, а конкретный upstream/provider — влиять на хранение, регион и доступность.

**Рекомендация для пилота.** Ограничить месячный бюджет и токены, включить provider allowlist/zero-data-retention только когда это подтверждено условиями конкретного провайдера, исключить персональные/коммерческие секреты до правовой проверки, вести журнал стоимости по задаче и кэшировать повторяемые контексты. API-пилот измеряет качество и объём, но не доказывает экономику собственного GPU без замера часов, токенов и доли ручной проверки.

### Валютные, санкционные и правовые риски

**Факты риска, не юридическое заключение.** Зарубежный GPU/API может потребовать иностранный способ оплаты, изменить доступность по стране/карте, приостановить аккаунт или сменить upstream. Передача документов зарубежному обработчику может затрагивать персональные данные, коммерческую тайну, трансграничную передачу и договорные ограничения. Даже российский ЦОД не гарантирует соответствие автоматически: важны договор, расположение резервных копий, субподрядчики, технические меры и роли оператора/обработчика.

**Рекомендация.** Для каждого внешнего сервиса до загрузки реальных данных зафиксировать: юрлицо и страну контрагента, DPA/условия обработки, retention, обучение на данных, список subprocessors, регион хранения, шифрование, экспорт/удаление, SLA, egress, налоги и план выхода. Это вопросы к ответственным за право, ИБ и финансы; отчёт не даёт юридической или финансовой гарантии.

## TCO/ROI на 12, 24 и 36 месяцев

### Методика

Модель находится в `data/roi-model.xlsx`. Жёлтые клетки и синий шрифт — входы; формулы не захардкожены. Сценарии используют разные уровни CAPEX, мощности, облачного замещения и реализуемой экономии труда.

**Первоначальная инвестиция:** оборудование + UPS + NAS/диски + монтаж + начальная интеграция.

**Ежемесячный on-prem OPEX:** электричество под нагрузкой и в idle + сопровождение + резервное копирование + математическое ожидание простоя + резерв отказов + остаточный API/облако.

**Ежемесячная ценность:** замещённый GPU/API + `часы труда × полная ставка × коэффициент реализации`.

**Чистый денежный эффект:** ценность − on-prem OPEX. Payback = первоначальная инвестиция / положительный месячный эффект. ROI горизонта = `(ценность × месяцы − cash TCO on-prem) / первоначальная инвестиция`.

Амортизация показана отдельно как экономическое потребление актива за 36 месяцев с остаточной стоимостью 10–20%. Она не заменяет налоговый или бухгалтерский расчёт.

### Входы сценариев

| Вход | Conservative | Base | Aggressive |
|---|---:|---:|---:|
| Вычислительное оборудование | 223 000 ₽ | 383 000 ₽ | 475 000 ₽ |
| UPS + NAS/диски + монтаж + интеграция | 170 000 ₽ | 245 000 ₽ | 315 000 ₽ |
| Первоначальная инвестиция | 393 000 ₽ | 628 000 ₽ | 790 000 ₽ |
| Электроэнергия | 14 ₽/кВт·ч | 11 ₽/кВт·ч | 9 ₽/кВт·ч |
| Реализуемая экономия труда | 5 880 ₽/мес. | 21 120 ₽/мес. | 94 500 ₽/мес. |
| Замещаемый cloud/API | 16 960 ₽/мес. | 43 499 ₽/мес. | 138 850 ₽/мес. |
| On-prem OPEX | 37 305 ₽/мес. | 34 062 ₽/мес. | 39 848 ₽/мес. |
| Чистый месячный эффект | −14 465 ₽ | 30 557 ₽ | 193 503 ₽ |

Тариф электричества, ставка труда, простой и реализация экономии — **допущения**, поскольку регион, договор энергоснабжения, фонд оплаты труда и процессы организации не заданы. Низкая цена электричества в aggressive компенсируется высокой загрузкой; это не прогноз тарифа.

### Результаты

| Сценарий | 12 месяцев | 24 месяца | 36 месяцев | Условный payback |
|---|---:|---:|---:|---:|
| Conservative | ROI −144,2%; эффект −566,6 тыс. ₽ | −188,3%; −740,2 тыс. ₽ | −232,5%; −913,7 тыс. ₽ | нет при отрицательном потоке |
| Base | ROI −41,6%; эффект −261,3 тыс. ₽ | +16,8%; +105,4 тыс. ₽ | +75,2%; +472,1 тыс. ₽ | 20,6 месяца |
| Aggressive | ROI +193,9%; эффект +1,532 млн ₽ | +487,9%; +3,854 млн ₽ | +781,8%; +6,176 млн ₽ | 4,1 месяца |

**Интерпретация.** Консервативный сценарий показывает, почему «железо окупится за год» нельзя обещать: при 40 замещённых GPU-часах и 12 сэкономленных рабочих часах ежемесячная ценность ниже эксплуатационных расходов. Базовый сценарий пересекает ноль между 12 и 24 месяцами. Aggressive даёт окупаемость менее года только при одновременном выполнении сильных условий: 250 GPU-часов ежемесячно, 70 часов потенциальной экономии труда, 75% фактической реализации и отсутствие серьёзного простоя.

**Условие окупаемости за 12 месяцев.** Для Base требуется средний чистый эффект не менее `628 000 / 12 = 52 333 ₽/мес.` вместо рассчитанных 30 557 ₽/мес. Разрыв — около 21 776 ₽/мес. Его можно закрыть, например, дополнительными 24,7 реализованными часами труда по 1 600 ₽ при коэффициенте 55%, либо сопоставимым подтверждённым замещением облака. До появления такого факта бюджет не должен утверждаться с обещанием годовой окупаемости.

### Что не забыть в закупке и эксплуатации

- UPS считать по реальной мощности и времени автономии, а не по ваттам GPU; для 5090-системы учитывать пусковые пики и 1000+ Вт PSU.
- NAS не является backup сам по себе: нужны версия, off-site/offline копия и тест восстановления.
- Заложить запасной NVMe, вентиляторы/термопасту, удалённое управление, мониторинг температуры и SMART.
- Для потребительских GPU проверить условия гарантии и круглосуточной нагрузки; GeForce не равна дата-центровой карте по ECC, форм-фактору и поддержке.
- Зафиксировать план возврата в облако при отказе, чтобы простой был ограничен.
- Проводить нагрузочный тест 72 часа, тест восстановления и замер токенов/с на фактических моделях до приёмки.

## Рекомендации и критерии выбора

### Решение на ближайший этап

1. Запустить 6–8-недельный пилот на OpenRouter и/или почасовом GPU без чувствительных данных, с бюджетным лимитом и логом токенов/GPU-часов.
2. Параллельно проверить один 64/128-ГБ Strix Halo на Qwen3.5-35B-A3B, Qwen3.5-122B-A10B Q4, Qwen3-VL, PaddleOCR-VL, Whisper и FLUX/SDXL.
3. Если медианная загрузка NVIDIA-совместимой работы превышает примерно 120 ч/мес. и нужен CUDA throughput — искать RTX 4090 или 2×3090, но утверждать бюджет только после проверенного предложения и burn-in.
4. Если основная работа — большие локальные LLM при малой конкурентности, взять 128-ГБ Ryzen AI Max+ 395; не обещать скорость H100/A100.
5. Через 8 недель заменить все жёлтые входы XLSX фактом, а не расширять модель новыми гипотезами.

### Критерии приёмки оборудования

- точный CPU/GPU/RAM/SSD и серийные номера совпадают с документами;
- память доступна в заявленном объёме, SSD SMART чистый, нет ошибок RAM;
- 72-часовой стресс-тест без throttling/ошибок, измерены температура, шум и энергопотребление;
- целевые модели запускаются из зафиксированного контейнера/окружения;
- измерены tokens/s, time-to-first-token, OCR pages/min, Whisper real-time factor и images/hour;
- есть restore из резервной копии, fallback в облако и список ответственных;
- гарантия, возврат и бухгалтерские документы подтверждены до оплаты.

## Источники

[^1]: AMD. [AMD Ryzen™ AI Max+ 395 — Specifications](https://www.amd.com/en/products/processors/laptop/ryzen/ai-300-series/amd-ryzen-ai-max-plus-395.html). Доступ 2026-09-09.
[^2]: Framework. [Framework Desktop with AMD Ryzen AI Max — specs and AI memory notes](https://frame.work/desktop). Доступ 2026-09-09.
[^3]: Framework. [Configure Framework Desktop DIY Edition](https://frame.work/products/desktop-diy-amd-aimax300/configuration/new). Цены $1 959 за Max+ 395/64 ГБ и $3 449 за Max+ 395/128 ГБ. Доступ 2026-09-09.
[^4]: NVIDIA. [GeForce RTX 3090 Family Specifications](https://www.nvidia.com/en-us/geforce/graphics-cards/30-series/rtx-3090-3090ti/). Доступ 2026-09-09.
[^5]: NVIDIA. [GeForce RTX 4090 Specifications](https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/). Доступ 2026-09-09.
[^6]: NVIDIA. [GeForce RTX 5090 Specifications](https://www.nvidia.com/en-us/geforce/graphics-cards/50-series/rtx-5090/). Доступ 2026-09-09.
[^7]: Regard. [Поиск RTX 5090](https://www.regard.ru/catalog?search=RTX%205090). Доступ 2026-09-09; цена — снимок страницы, не оферта отчёта.
[^8]: Regard. [Поиск RTX 4090](https://www.regard.ru/catalog?search=RTX%204090). Доступ 2026-09-09; цена — снимок страницы.
[^9]: Regard. [Поиск RTX 3090](https://www.regard.ru/catalog?search=RTX%203090). Доступ 2026-09-09; цена — снимок страницы.
[^10]: Cloud.ru. [Вычислительные мощности с GPU](https://cloud.ru/products/vychislitelnyye-moschnosti-s-gpu). Доступ 2026-09-09.
[^11]: VK Cloud. [Прайс-лист Cloud GPU](https://cloud.vk.ru/pricelist/). Доступ 2026-09-09.
[^12]: VK Cloud. [Cloud GPU](https://cloud.vk.ru/cloud-gpu/). Доступ 2026-09-09.
[^13]: Selectel. [Аренда выделенного сервера с GPU](https://selectel.ru/services/dedicated/gpu/). Доступ 2026-09-09.
[^14]: Yandex Cloud. [Правила тарификации Compute Cloud](https://yandex.cloud/ru/docs/compute/pricing). Доступ 2026-09-09.
[^15]: Runpod. [GPU Cloud Pricing](https://www.runpod.io/pricing). Доступ 2026-09-09.
[^16]: Vast.ai. [GPU Pricing](https://vast.ai/pricing). Доступ 2026-09-09.
[^17]: OpenRouter. [Models API](https://openrouter.ai/api/v1/models). JSON-снимок цен на 2026-09-09.
[^18]: Банк России. [Курсы валют на 09.09.2026](https://www.cbr.ru/scripts/XML_daily.asp?date_req=09/09/2026). USD/RUB 86,4730.
[^19]: Qwen. [Qwen3.5-9B model card](https://huggingface.co/Qwen/Qwen3.5-9B) и [Qwen3.5-27B](https://huggingface.co/Qwen/Qwen3.5-27B). Доступ 2026-09-09.
[^20]: Qwen. [Qwen3.5-35B-A3B model card](https://huggingface.co/Qwen/Qwen3.5-35B-A3B). Доступ 2026-09-09.
[^21]: Qwen. [Qwen3.5-122B-A10B model card](https://huggingface.co/Qwen/Qwen3.5-122B-A10B). Доступ 2026-09-09.
[^22]: Qwen. [Qwen3-VL-8B-Instruct model card](https://huggingface.co/Qwen/Qwen3-VL-8B-Instruct). Доступ 2026-09-09.
[^23]: Qwen. [Qwen3-Embedding-0.6B model card](https://huggingface.co/Qwen/Qwen3-Embedding-0.6B); BAAI. [BGE-M3](https://huggingface.co/BAAI/bge-m3). Доступ 2026-09-09.
[^24]: Qwen. [Qwen3-Reranker-0.6B](https://huggingface.co/Qwen/Qwen3-Reranker-0.6B); BAAI. [BGE reranker v2 m3](https://huggingface.co/BAAI/bge-reranker-v2-m3). Доступ 2026-09-09.
[^25]: DeepSeek AI. [DeepSeek-R1-Distill-Qwen-32B model card](https://huggingface.co/deepseek-ai/DeepSeek-R1-Distill-Qwen-32B). Доступ 2026-09-09.
[^26]: Meta. [Llama 3.3 70B Instruct model card and license](https://huggingface.co/meta-llama/Llama-3.3-70B-Instruct). Доступ 2026-09-09.
[^27]: OpenAI. [Whisper large-v3-turbo model card](https://huggingface.co/openai/whisper-large-v3-turbo). Доступ 2026-09-09.
[^28]: PaddlePaddle. [PaddleOCR-VL model card](https://huggingface.co/PaddlePaddle/PaddleOCR-VL). Доступ 2026-09-09.
[^29]: Black Forest Labs. [FLUX.1-schnell model card](https://huggingface.co/black-forest-labs/FLUX.1-schnell). Доступ 2026-09-09.
[^30]: Black Forest Labs. [FLUX.1-dev model card](https://huggingface.co/black-forest-labs/FLUX.1-dev) и [Non-Commercial License](https://bfl.ai/legal/non-commercial-license-terms). Доступ 2026-09-09.
[^31]: Stability AI. [Stable Diffusion XL Base 1.0 model card](https://huggingface.co/stabilityai/stable-diffusion-xl-base-1.0). Доступ 2026-09-09.
[^32]: AMD ROCm. [Radeon and Ryzen compatibility documentation](https://rocm.docs.amd.com/projects/radeon-ryzen/en/latest/). Доступ 2026-09-09.
[^33]: ggml-org. [llama.cpp](https://github.com/ggml-org/llama.cpp). Доступ 2026-09-09.
[^34]: vLLM. [Supported hardware](https://docs.vllm.ai/en/latest/getting_started/installation/gpu/). Доступ 2026-09-09.
[^35]: LF AI & Data / Docling Project. [Docling](https://github.com/docling-project/docling). Доступ 2026-09-09.
[^36]: The Document Foundation. [LibreOffice](https://www.libreoffice.org/about-us/licenses/). Доступ 2026-09-09.
[^37]: PptxGenJS. [Project repository](https://github.com/gitbrent/PptxGenJS). Доступ 2026-09-09.
[^38]: Open WebUI. [Project repository](https://github.com/open-webui/open-webui). Доступ 2026-09-09.
