LLM-Box Base — приватный ИИ (Qwen3-8B) в вашем облаке
LLM-Box Base — преднастроенный сервер приватного искусственного интеллекта. В образе собраны модель Qwen3-8B, движок инференса vLLM с OpenAI-совместимым API и веб-интерфейс Open WebUI (чат как в ChatGPT) за обратным прокси nginx.
Зачем это нужно. Доступ к зарубежным ИИ-сервисам ограничен, а бизнесу и госсектору важно, чтобы данные не покидали инфраструктуру. LLM-Box разворачивается в вашем облаке — запросы и данные остаются в вашем периметре.
Возможности:
— OpenAI-совместимый API: переключаете приложение на свой сервер сменой одного URL;
— веб-чат для сотрудников без навыков разработки;
— развёртывание в один клик, пароль и ключ генерируются при первом запуске;
— работает офлайн: модель запечена в образ, обращений во внешние сервисы не требуется.
Подходит для чат-ботов, поддержки клиентов, работы с документами, RAG и интеграции в приложения.
Модель Qwen3-8B распространяется под лицензией Apache 2.0.
- Создайте ВМ из этого образа на платформе с NVIDIA T4 (минимум 8 vCPU, 32 ГБ RAM, диск 60 ГБ), назначьте публичный IP.
- В группе безопасности сети откройте входящие порты 80/TCP (веб-чат и API) и 22/TCP (SSH).
- После старта сервисы поднимаются автоматически (2–5 минут на загрузку модели).
- Откройте http://<публичный IP>/ — веб-чат. Первый вход создаёт администратора.
- API доступен на http://<публичный IP>/v1 (OpenAI-совместимый). Адрес и API-ключ показываются в MOTD при входе по SSH.
- Для интеграции укажите этот адрес как OpenAI base URL и ключ из MOTD.
— Чат-боты и ассистенты на собственной модели без утечки данных.
— Поддержка клиентов: ответы на типовые вопросы внутри периметра.
— Работа с документами и RAG: поиск и ответы по внутренней базе знаний.
— Аналитика и суммаризация текстов и отчётов.
— Интеграция ИИ в приложения через OpenAI-совместимый API.
Техническая поддержка по электронной почте: info@papadata.ru. Помогаем с развёртыванием и эксплуатацией, отвечаем в течение 1–2 рабочих дней.
| ПО | Версия |
|---|---|
| Ubuntu | 24.04 |
| Qwen3-8B (AWQ) — языковая модель, Apache 2.0 | Qwen3-8B-AWQ |
| vLLM — движок инференса (OpenAI-совместимый API) | 0.26.0 |
| Open WebUI — веб-интерфейс чата | 0.11.0 |
| Docker + Docker Compose — среда запуска | Docker CE 27.x, Compose v2 |
| NVIDIA driver + CUDA — поддержка GPU | 595.84 · CUDA -13.2 |
| nginx — обратный прокси | 1.30.4 |