Системный проект · 06 октября 2026

Сервер для умного дома

Расчёт вычислительной нагрузки, выбранные модели, программный стек и конфигурация сервера. Подтверждённая техника и условия аппаратной приёмки.

Проектное решение · испытания оборудования впереди
Исходный отчётСпецификация стенда
Модели14B + 8BКоманды + изображения
Расчёт VRAM25,1 ГиБВыбран GPU на 32 ГБ
ИИ-сервер485 964 ₽8 компонентов · проверено 06.10
Реакция на команду≤5 секундЦель p95, ещё не benchmark
Голос / приложениеДо 6 клиентов · русский язык
→
Assist + WhisperЛокальное распознавание
→
Backend + QwenНамерение и проверка правил
→
Gateway → HAРазрешённое действие
→
ТехникаФактическое подтверждение
Обработка изображенийОтдельный запрос → Qwen3-VL → структурированные наблюдения
Контроллер Home AssistantСостояния и готовые сценарии работают независимо от ИИ-сервера

Проектное решение от 06.10.2026. Документ посвящён серверу: моделям, программному стеку, нагрузке, конфигурации и испытаниям. Перечень бытовой техники ограничен подтверждёнными покупками; выбранный телевизор указан отдельно по уточнению заказчика.

1. Вычислительная конфигурация

Home Assistant на отдельном контроллере + один локальный ИИ-сервер.

  • Модель команд и диалога: Qwen3-14B, Q4_K_M, без режима размышлений.
  • Модель изображений: Qwen3-VL-8B-Instruct, Q4_K_M, визуальный энкодер FP16.
  • Русская речь: Whisper large-v3-turbo Q5_0 → Piper ru_RU-dmitri-medium.
  • Исполнение моделей: llama.cpp HIP/ROCm, две постоянно загруженные модели, ограниченные очереди запросов.
  • Расчётная конфигурация ИИ-сервера: Ryzen 7 5700X, GIGABYTE Radeon AI PRO R9700 32 ГБ, RAM 64 ГБ DDR4, SSD 2 ТБ, Ubuntu 24.04.3 LTS + ROCm 7.2.
  • Контроллер дома: Intel N100, RAM 16 ГБ, SSD 512 ГБ, Home Assistant OS, проводная сеть.

Для заданных контекстов и параллельности бюджет GPU составляет 25,1 ГиБ. У выбранной конфигурации 32 ГБ выделенной видеопамяти; резерв рабочих буферов HIP и скорость проверяются на стенде. Расчёт 25,1 ГиБ сохранён как исходный бюджет, перенос на AMD ещё не измерен. Большие 70B-модели и обучение в эту нагрузку не входят.

2. Подтверждённая техника

ОборудованиеСтатусЗадача серверной системы
ASKO W7096XW ×2; T709HUW ×1КупленыПолучение статусов и завершения циклов; доступные команды проверяются через ConnectLife.TRIR
Samsung AirDresser DF24CB9900CRLPКупленПолучение доступных статусов и команд SmartThings после проверки конкретного прибора
Laurastar SMART M; IZZI PlusКупленыОтветы по инструкциям конкретных моделей; штатное управление человеком

Телевизор по уточнению заказчика: Samsung QN90F, 115 дюймов, выбран. Полный региональный SKU уточняется при подключении. Сервер обрабатывает команды громкости, mute, выбора источника и выключения через Home Assistant.

3. Рабочие сценарии сервера

ОбращениеЧто делает системаВычислительная нагрузка
«Что сейчас работает в постирочной?»Получает актуальные статусы двух стиралок и сушилки, возвращает время последнего обновленияHA + короткий ответ языковой модели
«Сообщи, когда закончится стирка»Регистрирует задачу по событию завершения конкретного прибораГотовое правило HA; LLM не следит за каждым событием
«Выключи телевизор / сделай тише»Вызывает разрешённую команду Samsung TV и проверяет результатКороткий структурированный вызов инструмента
«Как почистить Laurastar?»Ищет нужный раздел инструкции SMART M / IZZI Plus и отвечает со ссылкойSQLite FTS5 + языковая модель
Проверка изображения вещи и ярлыкаИзвлекает видимые данные в структурированную карточку, неизвестные поля оставляет неизвестнымиОдин вызов Qwen3-VL с двумя изображениями
Два обращения одновременноОбслуживает два ограниченных контекста; третье обращение ожидаетДва slots языковой модели + очередь

Отправка команды в прибор и подтверждение её исполнения учитываются раздельно. Удалённый запуск ASKO принимается в эксплуатацию только после проверки реальных возможностей купленных моделей.

4. Программная архитектура

На контроллере N100 работает HA OS, интеграции купленной техники, готовые scripts, база состояний и интерфейс. Здесь же размещаются conversation adapter и шлюз разрешённых действий. При отказе ИИ-сервера HA и штатное управление приборами продолжают работать.

На ИИ-сервере работают два процесса llama-server, whisper-server, Piper, backend на FastAPI/Pydantic, SQLite WAL/FTS5 и обработка отдельных изображений. Службы запускаются через systemd. Полное свободное голосовое управление зависит от ИИ-сервера, поскольку здесь выполняется распознавание речи.

Цепочка: Assist → Whisper → conversation adapter → backend + Qwen → action gateway → HA → подтверждение состояния → Piper. Вызовы инструментов валидируются по схеме; модель не получает доступ к shell и произвольной записи автоматизаций.

Реестр backend связывает понятные названия с разрешёнными entity_id и сервисами. Токен HA хранится на контроллере. Шлюз проверяет права, аргументы, актуальность состояния и повторные запросы. Итог действия: SUCCEEDED / FAILED / UNKNOWN; тайм-аут не превращается в сообщение «готово».

Именованные сценарии исполняет HA. Подсчёты событий делает SQL, инструкции ищутся через FTS5. Отдельная embedding-модель для текущего объёма документов не требуется. Разработка adapter поддерживается интерфейсами HA Conversation и HA LLM API.

5. Используемые интеграции и репозитории

КомпонентРешениеРоль
Home Assistanthome-assistant/coreСостояния, события, scripts, Assist
LLM/VLMggml-org/llama.cpp, multimodal docsGGUF, server API, обработка изображений
STTggml-org/whisper.cppЛокальное распознавание русской речи
Wyoming → STTser/wyoming-whisper-api-clientМост к локальному Whisper API
TTSOHF-Voice/piper1-gpl, wyoming-piperРусский голос на CPU
Пример conversation agentacon96/home-llmПример HA ↔ локальная модель для разработки собственного adapter
ASKOoyvindwe/connectlife-ha, mapping toolsЭкспериментальный TRIR; свойства конкретных моделей проверяются на приборах
AirDresserSmartThings integrationДоступные capabilities DF24 после диагностики
TVSamsung TV integrationЛокальные команды выбранного телевизора
Собственный backendHA adapter + action gateway + scheduler + журналРазрешённые инструменты, очереди, проверки и подтверждение результатов

ИИ и голос локальные, но ASKO TRIR и SmartThings сохраняют зависимости от внешних сервисов. По предупреждению HA бесплатный SmartThings API начинает выводиться из эксплуатации в октябре 2026; заявлен Personal Plan $4,99/мес. Доступность API AirDresser проверяется в регионе эксплуатации. Предупреждение HA.

6. Почему выбраны именно эти модели

Qwen3-14B Q4_K_M — языковой агент для русских фраз, уточнений и структурированных вызовов. Выбран умеренный размер с документированным GGUF и tool calling, а не максимальная модель общего назначения. Режим enable_thinking=false; инструментальные ответы до 128 токенов, обычный диалог до 256. На типовых командах backend использует краткие шаблоны фактического результата, поэтому второй проход генерации ответа не обязателен. Официальные веса.

Qwen3-VL-8B-Instruct Q4_K_M + mmproj FP16 — отдельный процесс изображений: вещь, ярлык и другие предоставленные изображения. Он не управляет устройствами. В запросе до двух снимков/crop, обычно 768–1024 px по длинной стороне; общий кадр уменьшается, ярлык вырезается из исходного 4K без предварительного уменьшения всего изображения. Лимит 1536 визуальных токенов на изображение, контекст 8192, структурированный вывод до 512 токенов. Официальный GGUF и отдельный энкодер.

Обе модели держим в памяти, чтобы не было смены весов при каждом обращении. Результаты распознавания проверяются программными правилами. Обучение на домашней одежде для начального внедрения не требуется; качество чтения ярлыков измеряется на предоставленной тестовой выборке.

Whisper/Piper — ещё две специализированные речевые модели, а не дополнительные бытовые агенты. Whisper multilingual, язык ru; словарь помещений и приборов задаётся в подсказке и нормализации. Piper голос dmitri medium работает на CPU. Выбор Qwen не является заявлением о лучшей модели на рынке октября 2026; он основан на проверенном формате, интерфейсах и достаточном размере для этого фиксированного контура.

7. Расчёт нагрузки и памяти

Расчётный режим дома

До шести голосовых клиентов; два одновременно активных диалога, один запрос VLM, один активный STT. Третье обращение ставится в очередь. Обработка изображений выполняется последовательно, поэтому три бытовых прибора не означают три одновременно работающих vision-модели.

Проектные допущения для суток: 200 голосовых обращений по 8 секунд аудио; 60 вещей, по два снимка на вещь; 30 дополнительных запросов по снимкам. Это допущения для расчёта сервера, не измеренная нагрузка. Интеграционные события и автоматизации не направляются в LLM непрерывно.

При суммарно 90 VLM-запросах (60 вещей с двумя изображениями в одном запросе плюс 30 дополнительных запросов) по условным 8 секундам и 200 голосовых цепочках по условным 4 секундам — 1520 секунд, около 25 минут/сутки активных вычислений. Эти времена являются расчётным примером duty cycle, а не benchmark. Пиковый одновременный режим проверяется отдельно, даже при низкой среднесуточной загрузке.

Память GPU

Размеры файлов получены из Hugging Face API 06.10.2026; ГиБ = 2³⁰ байт. Размер файла — нижний ориентир для весов, а не полное потребление процесса.

ПотребительРасчёт / основаниеБюджет, ГиБ
Qwen3-14B Q4_K_M9 001 752 960 байт, официальный GGUF8,384
Qwen3-VL-8B Q4_K_M5 027 784 800 байт, официальный GGUF4,682
Vision encoder FP161 159 029 824 байт, mmproj1,079
KV Qwen3-14B, два контекста 81922 × 40 layers × 8 KV heads × 128 × 2 bytes × 8192 × 2 slots2,500
KV VLM, один контекст 81922 × 36 layers × 8 KV heads × 128 × 2 bytes × 81921,125
Whisper, веса/рабочие буферыФайл Q5_0 ≈0,535 ГиБ; резерв до 2,5 с runtime2,500
HIP/вычислительные и vision буферыПроектный резерв для ограниченных batch/image sizes4,000
Дополнительные runtime allocationsПроектный резерв0,800
Итого бюджетБез CPU offload весов25,070
Запас относительно номинальных 32 ГиБУточнить реально доступную память, ECC/driver overhead6,930

Формула KV: 2(K,V) × layers × kv_heads × head_dim × bytes × tokens × slots. Размеры слоёв и голов взяты из официальных config.json Qwen3-14B и Qwen3-VL-8B. Расчёт воспроизводится файлом research-architecture-2026-10-06/calculate-sizing.cjs.

Вывод: минимальный выбранный класс — 32 ГБ GPU; 16 ГБ не хватает, 24 ГБ не оставляют необходимого резерва в этом режиме. Два процесса могут расходовать больше проектного резерва при слишком больших batch/изображениях: на стенде ограничить microbatch и добиться общей нагрузки ≤26 ГиБ. Это условия работоспособности конфигурации, а не гарантия размещения любого prompt.

RAM, CPU, SSD, сеть

  • 64 ГБ RAM: до 8 ГиБ ОС/служб, 6 backend/БД/речь/снимки, около 15 отображённых весов, до 16 временных копий при загрузке, 8 кэшей; расчётный пик около 53 ГиБ. mmap/page cache может перекрывать часть этих расходов, но на экономию не рассчитываем.
  • 8 ядер / 16 потоков: достаточно для очередей, БД, TTS и обработки отдельных снимков; STT/LLM/VLM используют GPU. Непрерывное перекодирование видео в эту серверную нагрузку не включено.
  • 2 ТБ SSD: 100 ГБ модели/две версии, 100 ОС/сборки, 50 базы/логи, до 30 изображения, 200 свободный эксплуатационный резерв. Не менее 20% SSD оставлять свободными. Увеличение диска не ускоряет загруженную LLM.
  • Архив изображений для расчёта SSD: 60 вещей ×2 JPEG ×2 МБ ×30 суток ≈7,2 ГБ. Это объём данных; оборудование для получения изображений в данном документе не подбирается.

Требуемая скорость, а не выдуманный benchmark

Проверка на готовой конфигурацииКритерий приёмки
Типовая локальная команда, один пользовательp95 ≤5 секунд от конца фразы до первой полезной реакции/ответа
Два пользователя + активная vision-проверкаp95 ≤8 секунд для типовой локальной команды
Вещь + ярлыкp95 ≤10 секунд до карточки; допустимость ухода подтверждается правилами/оператором
Запуск уже проверенной HA-сценыРеакция без LLM ≤1 секунды в локальном контуре, отдельно от устройства
SpeechRTF ≤0,25 на обычных фразах, тест с шумом; доля правильно выполненных типовых намерений ≥95%

Для 64 output tokens при 30 tokens/s генерация занимает 2,13 секунды. При 1,5 секунды STT и 0,5 секунды прочих действий на prefill/очередь остаётся около 0,9 секунды, чтобы уложиться в 5 секунд. 30 tokens/s — целевая планка теста, не измеренная скорость выбранной карты. Мерить отдельно prefill, decode, image encoder и ожидание очереди; рекламные TOPS не дают эти времена.

Очередь приоритетов: STT → короткая команда → vision → длинное объяснение/отчёт. В памяти одновременно обе модели, но большой vision-prefill не должен свободно конкурировать с голосовым prefill. Изображения дробятся ограниченным microbatch; фоновые новые запросы не стартуют при срочной команде. Запущенный GPU kernel невозможно мгновенно вытеснить программным приоритетом, поэтому соответствие p95 проверяется именно в смешанном тесте. Если лимиты не выдержаны, конфигурация не прошла приёмку; добавлять второй узел без такого теста не нужно.

8. Сервер и допустимые варианты покупки

Основной выбор: удешевлённая рабочая станция

Ryzen 7 5700X / Radeon AI PRO R9700 32 ГБ / RAM 64 ГБ / SSD 2 ТБ. Для закупки выбран один состав из восьми компонентов. Количество — по одной позиции, оперативная память покупается одним комплектом 2×32 ГБ.

Проверено 06.10.2026 в 11:48 МСК: открыты живые карточки всех восьми товаров, сохранены страницы, цены и статусы продавцов. Наличие подтверждено публичными карточками; товар ещё не зарезервирован, счёт от магазинов не получен.

КомпонентТочная модель и артикулЦена, ₽Где купитьНаличие и получение
ВидеокартаGIGABYTE Radeon AI PRO R9700 AI TOP 32 ГБ GDDR6; артикул GV-R9700AI TOP-32GD339 700ServerFlow · купить14 шт. в Санкт-Петербурге; бесплатное перемещение в Москву за 1–2 рабочих дня
ПроцессорAMD Ryzen 7 5700X OEM, AM4, 8 ядер / 16 потоков; артикул 100-00000092615 400Регард · купитьВ наличии; московский пункт выдачи после подтверждения заказа
Материнская платаMSI B550-A PRO, AM4, ATX; артикул B550-A PRO13 090Регард · купитьВ наличии; московский пункт выдачи после подтверждения заказа
Оперативная памятьPatriot Viper Steel DDR4-3200, 64 ГБ, комплект 2×32 ГБ; артикул PVS464G320C6K63 400Регард · купитьВ наличии; цена за комплект, требуется один комплект
SSDADATA LEGEND 860, 2 ТБ, M.2 2280, PCIe 4.0 x4; артикул SLEG-860-2000GCS30 990Регард · купитьВ наличии; московский пункт выдачи после подтверждения заказа
Кулер процессораDeepCool AK400, высота 155 мм, крепление AM4; артикул R-AK400-BKNNMN-G-12 300Регард · купитьВ наличии; московский пункт выдачи после подтверждения заказа
Блок питанияSeasonic Core GX-850, 850 Вт, ATX 3.1, 80 PLUS Gold; артикул CORE GX-850 ATX 3.114 459ANDPRO · купитьВ наличии; доставка по Москве 2–5 дней, на странице 1 000 ₽
КорпусDeepCool CC560 V2 Black, ATX, штатные вентиляторы; артикул R-CC560-BKGAA4-G-26 625ANDPRO · купитьВ наличии; доставка по Москве 2–5 дней, на странице 1 000 ₽
Итого оборудование8 позиций485 964Без доставки и работ

Цена памяти относится ко всему комплекту 64 ГБ; второй комплект не нужен. Ubuntu и используемое открытое ПО не требуют покупки лицензии Windows. Цены приведены как отображены магазинами; НДС повторно сверху не добавляется.

Магазины и конкретные места получения

МагазинЧто закупаем / суммаГде и как получитьКонтакт
ServerFlowВидеокарта — 339 700 ₽Фактический склад: Санкт-Петербург, ул. Заозёрная, 8, корп. 2Л, 14 шт. Московский склад: 2-я Брестская ул., 39, стр. 4, сейчас без остатка этой карты; продавец указывает бесплатное перемещение за 1–2 рабочих дня8 (800) 222-70-01, info@serverflow.ru; адреса и остатки — в карточке GPU
РегардCPU, плата, RAM, SSD, кулер — 125 180 ₽Москва, Волгоградский проспект, 21, стр. 10, подъезд 9. Пункт выдаёт только подтверждённые заказы. Все пять карточек показывают «В наличии»+7 (495) 921-41-58; контакты и самовывоз
ANDPROБП и корпус — 21 084 ₽На обеих карточках «В наличии»; доставка по Москве 2–5 дней. Показанный тариф — 1 000 ₽, итог для совместного заказа двух позиций фиксируется при оформлении+7 (495) 545-48-70, info@andpro.ru; условия доставки

Доставка, сборка и настройка оплачиваются отдельно. В 485 964 ₽ не включены контроллер Home Assistant, ИБП, сетевое оборудование, голосовые терминалы и разработка интеграций. Это стоимость ИИ-компьютера, а не всего умного дома.

Совместимость и программная конфигурация

  • AM4 / DDR4: MSI B550-A PRO, Ryzen 5700X и выбранный комплект 2×32 ГБ относятся к одной платформе. Перед сборкой обновить BIOS с поддержкой CPU. Модули устанавливаются в A2/B2; профиль DDR4-3200 принимается после проверки памяти. Спецификация платы.
  • Размещение: GPU — в основном процессорном PCIe 4.0 x16, SSD — в M2_1 PCIe 4.0 x4. У GPU длина 267 мм, у кулера высота 155 мм; лимиты CC560 V2 — 370/165 мм. Использовать штатный кабель БП для 12V-2x6, сверить комплект и ревизии при сборке. GIGABYTE, габариты корпуса.
  • ОС и вычисления: Ubuntu 24.04.3 LTS x86-64 с HWE 6.14 и ROCm 7.2 — исходная поддерживаемая матрица AMD. R9700 присутствует в списке GPU; точные пакеты закрепляются на стенде. llama.cpp и whisper.cpp собираются с HIP/ROCm, Piper работает на CPU. Матрица AMD, сборка llama.cpp, параметр HIP в whisper.cpp.
  • Сеть: проводной Ethernet 1 Гбит/с платы, постоянное назначение IP через DHCP reservation. Доступ администратора через локальную сеть/VPN. Home Assistant остаётся на отдельном N100.

У Radeon AI PRO R9700 32 ГБ выделенной GDDR6, 640 ГБ/с, TBP 300 Вт. Спецификация AMD. Модели и лимиты контекстов сохраняются: Qwen3-14B Q4_K_M, Qwen3-VL-8B-Instruct Q4_K_M + FP16 encoder, Whisper large-v3-turbo Q5_0, Piper ru_RU-dmitri-medium.

Приёмка AMD-сборки обязательна: обе основные модели и речь активны, два пользователя и один vision-запрос, 72 часа без OOM/перезапусков. Цели p95 — ≤5 с для одиночной команды, ≤8 с при смешанной нагрузке, ≤10 с для изображения. Вместимость по исходному расчёту 25,1 ГиБ не доказывает скорость; рабочие буферы HIP повторно измеряются.

Электропотребление и ИБП

Для питания и охлаждения выделить 500 Вт проектного резерва на ИИ-компьютер, около 20 Вт на HA; сеть и потери ИБП учитываются отдельно. GPU имеет TBP 300 Вт, CPU — TDP 65 Вт, БП — предел 850 Вт: фактическую мощность сервера измеряем из розетки после сборки.

Потребление за месяц рассчитывается по измеренному режиму: (P ожидания × часов ожидания + P нагрузки × часов нагрузки) × 30 / 1000, где P задана в ваттах, время — за сутки. Тариф дома применяется к полученным кВт·ч.

Для предварительного ТЗ сохраняется ИБП 1500 ВА / не менее 900 Вт, синус, USB/NUT. Точная модель и 10 минут автономии выбираются по кривой производителя после измерения суммарной нагрузки. Штатное завершение — сначала ИИ, затем HA. Сервер размещается в сухом проветриваемом техническом помещении.

9. Развёртывание и приёмка сервера

  1. Поднять HA OS на контроллере. Получить diagnostics купленных ASKO и AirDresser; проверить фактические поля и команды. Для телевизора зафиксировать полный SKU.
  2. Установить Linux из поддерживаемой матрицы AMD, драйвер и ROCm, закрепить версии llama.cpp, Whisper и моделей. Запустить две модели и речевые службы.
  3. Реализовать conversation adapter, backend, gateway, реестр разрешённых действий и журнал. Проверить возврат фактического результата.
  4. Прогреть оба текстовых контекста и vision-запрос максимального размера. Измерить GPU/RAM, prefill, decode, распознавание речи и очереди.
  5. Провести 72-часовой тест, смешанную нагрузку, перезагрузку, отказ интернета и ИИ-сервера, завершение от ИБП и восстановление backup.

Проверить минимум 200 русских фраз с синонимами и уточнениями, часть — при фоновом шуме. Для VLM использовать заранее размеченную выборку изображений и ярлыков; корректность наблюдений проверяется отдельно от скорости вычислений.

LLM endpoints слушают localhost. Шлюз принимает только авторизованные запросы. Удалённый административный доступ — VPN. Ежедневные зашифрованные backup HA и SQLite сохраняются на независимом хранилище. Обновления сначала проверяются на стенде; прежняя рабочая версия сохраняется для отката.

Стоимость оборудования ИИ-сервера по проверенным карточкам — 485 964 ₽ на 06.10.2026, 11:48 МСК. Контроллер Home Assistant, сеть, ИБП и разработка учитываются отдельной сметой. Перечень дополнительной бытовой техники в этот документ не включён.