Проектное решение от 06.10.2026. Документ посвящён серверу: моделям, программному стеку, нагрузке, конфигурации и испытаниям. Перечень бытовой техники ограничен подтверждёнными покупками; выбранный телевизор указан отдельно по уточнению заказчика.
1. Вычислительная конфигурация
Home Assistant на отдельном контроллере + один локальный ИИ-сервер.
- Модель команд и диалога: Qwen3-14B, Q4_K_M, без режима размышлений.
- Модель изображений: Qwen3-VL-8B-Instruct, Q4_K_M, визуальный энкодер FP16.
- Русская речь: Whisper large-v3-turbo Q5_0 → Piper ru_RU-dmitri-medium.
- Исполнение моделей: llama.cpp HIP/ROCm, две постоянно загруженные модели, ограниченные очереди запросов.
- Расчётная конфигурация ИИ-сервера: Ryzen 7 5700X, GIGABYTE Radeon AI PRO R9700 32 ГБ, RAM 64 ГБ DDR4, SSD 2 ТБ, Ubuntu 24.04.3 LTS + ROCm 7.2.
- Контроллер дома: Intel N100, RAM 16 ГБ, SSD 512 ГБ, Home Assistant OS, проводная сеть.
Для заданных контекстов и параллельности бюджет GPU составляет 25,1 ГиБ. У выбранной конфигурации 32 ГБ выделенной видеопамяти; резерв рабочих буферов HIP и скорость проверяются на стенде. Расчёт 25,1 ГиБ сохранён как исходный бюджет, перенос на AMD ещё не измерен. Большие 70B-модели и обучение в эту нагрузку не входят.
2. Подтверждённая техника
| Оборудование | Статус | Задача серверной системы |
|---|---|---|
| ASKO W7096XW ×2; T709HUW ×1 | Куплены | Получение статусов и завершения циклов; доступные команды проверяются через ConnectLife.TRIR |
| Samsung AirDresser DF24CB9900CRLP | Куплен | Получение доступных статусов и команд SmartThings после проверки конкретного прибора |
| Laurastar SMART M; IZZI Plus | Куплены | Ответы по инструкциям конкретных моделей; штатное управление человеком |
Телевизор по уточнению заказчика: Samsung QN90F, 115 дюймов, выбран. Полный региональный SKU уточняется при подключении. Сервер обрабатывает команды громкости, mute, выбора источника и выключения через Home Assistant.
3. Рабочие сценарии сервера
| Обращение | Что делает система | Вычислительная нагрузка |
|---|---|---|
| «Что сейчас работает в постирочной?» | Получает актуальные статусы двух стиралок и сушилки, возвращает время последнего обновления | HA + короткий ответ языковой модели |
| «Сообщи, когда закончится стирка» | Регистрирует задачу по событию завершения конкретного прибора | Готовое правило HA; LLM не следит за каждым событием |
| «Выключи телевизор / сделай тише» | Вызывает разрешённую команду Samsung TV и проверяет результат | Короткий структурированный вызов инструмента |
| «Как почистить Laurastar?» | Ищет нужный раздел инструкции SMART M / IZZI Plus и отвечает со ссылкой | SQLite FTS5 + языковая модель |
| Проверка изображения вещи и ярлыка | Извлекает видимые данные в структурированную карточку, неизвестные поля оставляет неизвестными | Один вызов Qwen3-VL с двумя изображениями |
| Два обращения одновременно | Обслуживает два ограниченных контекста; третье обращение ожидает | Два slots языковой модели + очередь |
Отправка команды в прибор и подтверждение её исполнения учитываются раздельно. Удалённый запуск ASKO принимается в эксплуатацию только после проверки реальных возможностей купленных моделей.
4. Программная архитектура
На контроллере N100 работает HA OS, интеграции купленной техники, готовые scripts, база состояний и интерфейс. Здесь же размещаются conversation adapter и шлюз разрешённых действий. При отказе ИИ-сервера HA и штатное управление приборами продолжают работать.
На ИИ-сервере работают два процесса llama-server, whisper-server, Piper, backend на FastAPI/Pydantic, SQLite WAL/FTS5 и обработка отдельных изображений. Службы запускаются через systemd. Полное свободное голосовое управление зависит от ИИ-сервера, поскольку здесь выполняется распознавание речи.
Цепочка: Assist → Whisper → conversation adapter → backend + Qwen → action gateway → HA → подтверждение состояния → Piper. Вызовы инструментов валидируются по схеме; модель не получает доступ к shell и произвольной записи автоматизаций.
Реестр backend связывает понятные названия с разрешёнными entity_id и сервисами. Токен HA хранится на контроллере. Шлюз проверяет права, аргументы, актуальность состояния и повторные запросы. Итог действия: SUCCEEDED / FAILED / UNKNOWN; тайм-аут не превращается в сообщение «готово».
Именованные сценарии исполняет HA. Подсчёты событий делает SQL, инструкции ищутся через FTS5. Отдельная embedding-модель для текущего объёма документов не требуется. Разработка adapter поддерживается интерфейсами HA Conversation и HA LLM API.
5. Используемые интеграции и репозитории
| Компонент | Решение | Роль |
|---|---|---|
| Home Assistant | home-assistant/core | Состояния, события, scripts, Assist |
| LLM/VLM | ggml-org/llama.cpp, multimodal docs | GGUF, server API, обработка изображений |
| STT | ggml-org/whisper.cpp | Локальное распознавание русской речи |
| Wyoming → STT | ser/wyoming-whisper-api-client | Мост к локальному Whisper API |
| TTS | OHF-Voice/piper1-gpl, wyoming-piper | Русский голос на CPU |
| Пример conversation agent | acon96/home-llm | Пример HA ↔ локальная модель для разработки собственного adapter |
| ASKO | oyvindwe/connectlife-ha, mapping tools | Экспериментальный TRIR; свойства конкретных моделей проверяются на приборах |
| AirDresser | SmartThings integration | Доступные capabilities DF24 после диагностики |
| TV | Samsung TV integration | Локальные команды выбранного телевизора |
| Собственный backend | HA adapter + action gateway + scheduler + журнал | Разрешённые инструменты, очереди, проверки и подтверждение результатов |
ИИ и голос локальные, но ASKO TRIR и SmartThings сохраняют зависимости от внешних сервисов. По предупреждению HA бесплатный SmartThings API начинает выводиться из эксплуатации в октябре 2026; заявлен Personal Plan $4,99/мес. Доступность API AirDresser проверяется в регионе эксплуатации. Предупреждение HA.
6. Почему выбраны именно эти модели
Qwen3-14B Q4_K_M — языковой агент для русских фраз, уточнений и структурированных вызовов. Выбран умеренный размер с документированным GGUF и tool calling, а не максимальная модель общего назначения. Режим enable_thinking=false; инструментальные ответы до 128 токенов, обычный диалог до 256. На типовых командах backend использует краткие шаблоны фактического результата, поэтому второй проход генерации ответа не обязателен. Официальные веса.
Qwen3-VL-8B-Instruct Q4_K_M + mmproj FP16 — отдельный процесс изображений: вещь, ярлык и другие предоставленные изображения. Он не управляет устройствами. В запросе до двух снимков/crop, обычно 768–1024 px по длинной стороне; общий кадр уменьшается, ярлык вырезается из исходного 4K без предварительного уменьшения всего изображения. Лимит 1536 визуальных токенов на изображение, контекст 8192, структурированный вывод до 512 токенов. Официальный GGUF и отдельный энкодер.
Обе модели держим в памяти, чтобы не было смены весов при каждом обращении. Результаты распознавания проверяются программными правилами. Обучение на домашней одежде для начального внедрения не требуется; качество чтения ярлыков измеряется на предоставленной тестовой выборке.
Whisper/Piper — ещё две специализированные речевые модели, а не дополнительные бытовые агенты. Whisper multilingual, язык ru; словарь помещений и приборов задаётся в подсказке и нормализации. Piper голос dmitri medium работает на CPU. Выбор Qwen не является заявлением о лучшей модели на рынке октября 2026; он основан на проверенном формате, интерфейсах и достаточном размере для этого фиксированного контура.
7. Расчёт нагрузки и памяти
Расчётный режим дома
До шести голосовых клиентов; два одновременно активных диалога, один запрос VLM, один активный STT. Третье обращение ставится в очередь. Обработка изображений выполняется последовательно, поэтому три бытовых прибора не означают три одновременно работающих vision-модели.
Проектные допущения для суток: 200 голосовых обращений по 8 секунд аудио; 60 вещей, по два снимка на вещь; 30 дополнительных запросов по снимкам. Это допущения для расчёта сервера, не измеренная нагрузка. Интеграционные события и автоматизации не направляются в LLM непрерывно.
При суммарно 90 VLM-запросах (60 вещей с двумя изображениями в одном запросе плюс 30 дополнительных запросов) по условным 8 секундам и 200 голосовых цепочках по условным 4 секундам — 1520 секунд, около 25 минут/сутки активных вычислений. Эти времена являются расчётным примером duty cycle, а не benchmark. Пиковый одновременный режим проверяется отдельно, даже при низкой среднесуточной загрузке.
Память GPU
Размеры файлов получены из Hugging Face API 06.10.2026; ГиБ = 2³⁰ байт. Размер файла — нижний ориентир для весов, а не полное потребление процесса.
| Потребитель | Расчёт / основание | Бюджет, ГиБ |
|---|---|---|
| Qwen3-14B Q4_K_M | 9 001 752 960 байт, официальный GGUF | 8,384 |
| Qwen3-VL-8B Q4_K_M | 5 027 784 800 байт, официальный GGUF | 4,682 |
| Vision encoder FP16 | 1 159 029 824 байт, mmproj | 1,079 |
| KV Qwen3-14B, два контекста 8192 | 2 × 40 layers × 8 KV heads × 128 × 2 bytes × 8192 × 2 slots | 2,500 |
| KV VLM, один контекст 8192 | 2 × 36 layers × 8 KV heads × 128 × 2 bytes × 8192 | 1,125 |
| Whisper, веса/рабочие буферы | Файл Q5_0 ≈0,535 ГиБ; резерв до 2,5 с runtime | 2,500 |
| HIP/вычислительные и vision буферы | Проектный резерв для ограниченных batch/image sizes | 4,000 |
| Дополнительные runtime allocations | Проектный резерв | 0,800 |
| Итого бюджет | Без CPU offload весов | 25,070 |
| Запас относительно номинальных 32 ГиБ | Уточнить реально доступную память, ECC/driver overhead | 6,930 |
Формула KV: 2(K,V) × layers × kv_heads × head_dim × bytes × tokens × slots. Размеры слоёв и голов взяты из официальных config.json Qwen3-14B и Qwen3-VL-8B. Расчёт воспроизводится файлом research-architecture-2026-10-06/calculate-sizing.cjs.
Вывод: минимальный выбранный класс — 32 ГБ GPU; 16 ГБ не хватает, 24 ГБ не оставляют необходимого резерва в этом режиме. Два процесса могут расходовать больше проектного резерва при слишком больших batch/изображениях: на стенде ограничить microbatch и добиться общей нагрузки ≤26 ГиБ. Это условия работоспособности конфигурации, а не гарантия размещения любого prompt.
RAM, CPU, SSD, сеть
- 64 ГБ RAM: до 8 ГиБ ОС/служб, 6 backend/БД/речь/снимки, около 15 отображённых весов, до 16 временных копий при загрузке, 8 кэшей; расчётный пик около 53 ГиБ. mmap/page cache может перекрывать часть этих расходов, но на экономию не рассчитываем.
- 8 ядер / 16 потоков: достаточно для очередей, БД, TTS и обработки отдельных снимков; STT/LLM/VLM используют GPU. Непрерывное перекодирование видео в эту серверную нагрузку не включено.
- 2 ТБ SSD: 100 ГБ модели/две версии, 100 ОС/сборки, 50 базы/логи, до 30 изображения, 200 свободный эксплуатационный резерв. Не менее 20% SSD оставлять свободными. Увеличение диска не ускоряет загруженную LLM.
- Архив изображений для расчёта SSD: 60 вещей ×2 JPEG ×2 МБ ×30 суток ≈7,2 ГБ. Это объём данных; оборудование для получения изображений в данном документе не подбирается.
Требуемая скорость, а не выдуманный benchmark
| Проверка на готовой конфигурации | Критерий приёмки |
|---|---|
| Типовая локальная команда, один пользователь | p95 ≤5 секунд от конца фразы до первой полезной реакции/ответа |
| Два пользователя + активная vision-проверка | p95 ≤8 секунд для типовой локальной команды |
| Вещь + ярлык | p95 ≤10 секунд до карточки; допустимость ухода подтверждается правилами/оператором |
| Запуск уже проверенной HA-сцены | Реакция без LLM ≤1 секунды в локальном контуре, отдельно от устройства |
| Speech | RTF ≤0,25 на обычных фразах, тест с шумом; доля правильно выполненных типовых намерений ≥95% |
Для 64 output tokens при 30 tokens/s генерация занимает 2,13 секунды. При 1,5 секунды STT и 0,5 секунды прочих действий на prefill/очередь остаётся около 0,9 секунды, чтобы уложиться в 5 секунд. 30 tokens/s — целевая планка теста, не измеренная скорость выбранной карты. Мерить отдельно prefill, decode, image encoder и ожидание очереди; рекламные TOPS не дают эти времена.
Очередь приоритетов: STT → короткая команда → vision → длинное объяснение/отчёт. В памяти одновременно обе модели, но большой vision-prefill не должен свободно конкурировать с голосовым prefill. Изображения дробятся ограниченным microbatch; фоновые новые запросы не стартуют при срочной команде. Запущенный GPU kernel невозможно мгновенно вытеснить программным приоритетом, поэтому соответствие p95 проверяется именно в смешанном тесте. Если лимиты не выдержаны, конфигурация не прошла приёмку; добавлять второй узел без такого теста не нужно.
8. Сервер и допустимые варианты покупки
Основной выбор: удешевлённая рабочая станция
Ryzen 7 5700X / Radeon AI PRO R9700 32 ГБ / RAM 64 ГБ / SSD 2 ТБ. Для закупки выбран один состав из восьми компонентов. Количество — по одной позиции, оперативная память покупается одним комплектом 2×32 ГБ.
Проверено 06.10.2026 в 11:48 МСК: открыты живые карточки всех восьми товаров, сохранены страницы, цены и статусы продавцов. Наличие подтверждено публичными карточками; товар ещё не зарезервирован, счёт от магазинов не получен.
| Компонент | Точная модель и артикул | Цена, ₽ | Где купить | Наличие и получение |
|---|---|---|---|---|
| Видеокарта | GIGABYTE Radeon AI PRO R9700 AI TOP 32 ГБ GDDR6; артикул GV-R9700AI TOP-32GD | 339 700 | ServerFlow · купить | 14 шт. в Санкт-Петербурге; бесплатное перемещение в Москву за 1–2 рабочих дня |
| Процессор | AMD Ryzen 7 5700X OEM, AM4, 8 ядер / 16 потоков; артикул 100-000000926 | 15 400 | Регард · купить | В наличии; московский пункт выдачи после подтверждения заказа |
| Материнская плата | MSI B550-A PRO, AM4, ATX; артикул B550-A PRO | 13 090 | Регард · купить | В наличии; московский пункт выдачи после подтверждения заказа |
| Оперативная память | Patriot Viper Steel DDR4-3200, 64 ГБ, комплект 2×32 ГБ; артикул PVS464G320C6K | 63 400 | Регард · купить | В наличии; цена за комплект, требуется один комплект |
| SSD | ADATA LEGEND 860, 2 ТБ, M.2 2280, PCIe 4.0 x4; артикул SLEG-860-2000GCS | 30 990 | Регард · купить | В наличии; московский пункт выдачи после подтверждения заказа |
| Кулер процессора | DeepCool AK400, высота 155 мм, крепление AM4; артикул R-AK400-BKNNMN-G-1 | 2 300 | Регард · купить | В наличии; московский пункт выдачи после подтверждения заказа |
| Блок питания | Seasonic Core GX-850, 850 Вт, ATX 3.1, 80 PLUS Gold; артикул CORE GX-850 ATX 3.1 | 14 459 | ANDPRO · купить | В наличии; доставка по Москве 2–5 дней, на странице 1 000 ₽ |
| Корпус | DeepCool CC560 V2 Black, ATX, штатные вентиляторы; артикул R-CC560-BKGAA4-G-2 | 6 625 | ANDPRO · купить | В наличии; доставка по Москве 2–5 дней, на странице 1 000 ₽ |
| Итого оборудование | 8 позиций | 485 964 | Без доставки и работ |
Цена памяти относится ко всему комплекту 64 ГБ; второй комплект не нужен. Ubuntu и используемое открытое ПО не требуют покупки лицензии Windows. Цены приведены как отображены магазинами; НДС повторно сверху не добавляется.
Магазины и конкретные места получения
| Магазин | Что закупаем / сумма | Где и как получить | Контакт |
|---|---|---|---|
| ServerFlow | Видеокарта — 339 700 ₽ | Фактический склад: Санкт-Петербург, ул. Заозёрная, 8, корп. 2Л, 14 шт. Московский склад: 2-я Брестская ул., 39, стр. 4, сейчас без остатка этой карты; продавец указывает бесплатное перемещение за 1–2 рабочих дня | 8 (800) 222-70-01, info@serverflow.ru; адреса и остатки — в карточке GPU |
| Регард | CPU, плата, RAM, SSD, кулер — 125 180 ₽ | Москва, Волгоградский проспект, 21, стр. 10, подъезд 9. Пункт выдаёт только подтверждённые заказы. Все пять карточек показывают «В наличии» | +7 (495) 921-41-58; контакты и самовывоз |
| ANDPRO | БП и корпус — 21 084 ₽ | На обеих карточках «В наличии»; доставка по Москве 2–5 дней. Показанный тариф — 1 000 ₽, итог для совместного заказа двух позиций фиксируется при оформлении | +7 (495) 545-48-70, info@andpro.ru; условия доставки |
Доставка, сборка и настройка оплачиваются отдельно. В 485 964 ₽ не включены контроллер Home Assistant, ИБП, сетевое оборудование, голосовые терминалы и разработка интеграций. Это стоимость ИИ-компьютера, а не всего умного дома.
Совместимость и программная конфигурация
- AM4 / DDR4: MSI B550-A PRO, Ryzen 5700X и выбранный комплект 2×32 ГБ относятся к одной платформе. Перед сборкой обновить BIOS с поддержкой CPU. Модули устанавливаются в A2/B2; профиль DDR4-3200 принимается после проверки памяти. Спецификация платы.
- Размещение: GPU — в основном процессорном PCIe 4.0 x16, SSD — в M2_1 PCIe 4.0 x4. У GPU длина 267 мм, у кулера высота 155 мм; лимиты CC560 V2 — 370/165 мм. Использовать штатный кабель БП для 12V-2x6, сверить комплект и ревизии при сборке. GIGABYTE, габариты корпуса.
- ОС и вычисления: Ubuntu 24.04.3 LTS x86-64 с HWE 6.14 и ROCm 7.2 — исходная поддерживаемая матрица AMD. R9700 присутствует в списке GPU; точные пакеты закрепляются на стенде. llama.cpp и whisper.cpp собираются с HIP/ROCm, Piper работает на CPU. Матрица AMD, сборка llama.cpp, параметр HIP в whisper.cpp.
- Сеть: проводной Ethernet 1 Гбит/с платы, постоянное назначение IP через DHCP reservation. Доступ администратора через локальную сеть/VPN. Home Assistant остаётся на отдельном N100.
У Radeon AI PRO R9700 32 ГБ выделенной GDDR6, 640 ГБ/с, TBP 300 Вт. Спецификация AMD. Модели и лимиты контекстов сохраняются: Qwen3-14B Q4_K_M, Qwen3-VL-8B-Instruct Q4_K_M + FP16 encoder, Whisper large-v3-turbo Q5_0, Piper ru_RU-dmitri-medium.
Приёмка AMD-сборки обязательна: обе основные модели и речь активны, два пользователя и один vision-запрос, 72 часа без OOM/перезапусков. Цели p95 — ≤5 с для одиночной команды, ≤8 с при смешанной нагрузке, ≤10 с для изображения. Вместимость по исходному расчёту 25,1 ГиБ не доказывает скорость; рабочие буферы HIP повторно измеряются.
Электропотребление и ИБП
Для питания и охлаждения выделить 500 Вт проектного резерва на ИИ-компьютер, около 20 Вт на HA; сеть и потери ИБП учитываются отдельно. GPU имеет TBP 300 Вт, CPU — TDP 65 Вт, БП — предел 850 Вт: фактическую мощность сервера измеряем из розетки после сборки.
Потребление за месяц рассчитывается по измеренному режиму: (P ожидания × часов ожидания + P нагрузки × часов нагрузки) × 30 / 1000, где P задана в ваттах, время — за сутки. Тариф дома применяется к полученным кВт·ч.
Для предварительного ТЗ сохраняется ИБП 1500 ВА / не менее 900 Вт, синус, USB/NUT. Точная модель и 10 минут автономии выбираются по кривой производителя после измерения суммарной нагрузки. Штатное завершение — сначала ИИ, затем HA. Сервер размещается в сухом проветриваемом техническом помещении.
9. Развёртывание и приёмка сервера
- Поднять HA OS на контроллере. Получить diagnostics купленных ASKO и AirDresser; проверить фактические поля и команды. Для телевизора зафиксировать полный SKU.
- Установить Linux из поддерживаемой матрицы AMD, драйвер и ROCm, закрепить версии llama.cpp, Whisper и моделей. Запустить две модели и речевые службы.
- Реализовать conversation adapter, backend, gateway, реестр разрешённых действий и журнал. Проверить возврат фактического результата.
- Прогреть оба текстовых контекста и vision-запрос максимального размера. Измерить GPU/RAM, prefill, decode, распознавание речи и очереди.
- Провести 72-часовой тест, смешанную нагрузку, перезагрузку, отказ интернета и ИИ-сервера, завершение от ИБП и восстановление backup.
Проверить минимум 200 русских фраз с синонимами и уточнениями, часть — при фоновом шуме. Для VLM использовать заранее размеченную выборку изображений и ярлыков; корректность наблюдений проверяется отдельно от скорости вычислений.
LLM endpoints слушают localhost. Шлюз принимает только авторизованные запросы. Удалённый административный доступ — VPN. Ежедневные зашифрованные backup HA и SQLite сохраняются на независимом хранилище. Обновления сначала проверяются на стенде; прежняя рабочая версия сохраняется для отката.
Стоимость оборудования ИИ-сервера по проверенным карточкам — 485 964 ₽ на 06.10.2026, 11:48 МСК. Контроллер Home Assistant, сеть, ИБП и разработка учитываются отдельной сметой. Перечень дополнительной бытовой техники в этот документ не включён.