Загрузка данных
Твоя задача — полностью установить, настроить, оптимизировать и протестировать локальный запуск модели Qwen3.8-27B на этом компьютере.
Не ограничивайся инструкцией для меня — самостоятельно выполняй необходимые команды, устанавливай зависимости, скачивай модель, создавай конфиги и запускай тесты.
## Мой компьютер
* CPU: AMD Ryzen 9 9950X
* GPU: NVIDIA GeForce RTX 5090 32 GB VRAM
* RAM: 128 GB
* Основная цель: программирование / coding agent / локальный аналог Claude Code
* Модель должна по возможности полностью работать на GPU.
* CPU/RAM offload нежелателен.
* После запуска модели желательно оставить минимум 30–40 GB свободной системной RAM.
* Не допускай использования swap/pagefile моделью вместо нормального GPU inference.
* Не устанавливай заведомо устаревшие версии библиотек.
## Нужная модель
Qwen3.8-27B
Официальная исходная модель:
Qwen/Qwen3.8-27B
Для локального запуска используй качественный GGUF из:
ggml-org/Qwen3.8-27B-GGUF
Предпочтительный порядок quantization:
1. Q5_K_M — основной желаемый вариант
2. Q4_K_M — если Q5_K_M вместе с KV cache не помещается нормально в 32 GB VRAM
Не используй Q2/Q3, если в этом нет необходимости.
Не выбирай Q6/Q8/BF16, если из-за этого модель перестанет полностью помещаться в VRAM или потребуется значительный CPU offload.
## Этап 1. Сначала проанализируй систему
Перед установкой:
1. Определи:
* Windows / Linux / WSL
* версию Windows/Linux
* используется ли WSL2
* версию драйвера NVIDIA
* версию CUDA, доступную драйверу
* доступность `nvidia-smi`
* установлен ли Git
* установлен ли Python
* установлен ли CMake
* установлен ли Visual Studio Build Tools / GCC
* установлен ли Node.js
* установлен ли llama.cpp
* установлен ли Ollama
2. Выполни:
nvidia-smi
3. Убедись, что RTX 5090 определяется корректно и доступны все 32 GB VRAM.
4. Проверь свободное место на дисках.
5. Выбери разумную директорию для моделей.
Желательно не складывать десятки гигабайт модели в случайные временные директории или cache, если можно сделать нормальную постоянную папку вроде:
AI/models/Qwen3.8-27B
Используй подходящий путь для текущей ОС.
## Этап 2. Выбери оптимальный runtime
Основной приоритет:
llama.cpp с CUDA acceleration.
Используй актуальную версию llama.cpp с поддержкой Qwen3.8 и RTX 5090.
Если установленная версия старая — обнови.
Если llama.cpp необходимо собирать самостоятельно, собирай с CUDA.
Проверь после сборки, что CUDA действительно включена.
Не допускай ситуации, когда llama.cpp незаметно работает только через CPU.
Ollama можно установить дополнительно для удобства, но основным высокопроизводительным backend желательно оставить llama.cpp, если он нормально работает.
## Этап 3. Установка модели
Сначала попробуй:
ggml-org/Qwen3.8-27B-GGUF:Q5_K_M
Если такого quant в репозитории сейчас нет либо он по фактическим тестам оказывается неоптимальным для 32 GB RTX 5090, используй:
ggml-org/Qwen3.8-27B-GGUF:Q4_K_M
Скачивай только необходимые файлы.
Для первоначального coding/text setup не скачивай дополнительные multimodal/vision файлы, если они не нужны для обычной текстовой работы.
Не скачивай одновременно Q4, Q5, Q6 и Q8 просто для тестирования.
Если сначала установлен Q5 и выясняется, что он непригоден, перед скачиванием Q4 объясни причину и после успешной настройки предложи удалить ненужный Q5.
## Этап 4. Оптимизация под RTX 5090
Главная цель:
ВСЕ основные model layers должны находиться на RTX 5090.
Настрой максимально возможный GPU offload.
Для llama.cpp используй GPU layers таким образом, чтобы вся модель находилась на GPU, если это возможно.
Начальный context:
32768 tokens.
После стабильного запуска попробуй определить, можно ли увеличить context до:
65536 tokens
без CPU offload, out-of-memory и без заполнения практически всех 32 GB VRAM.
Не ставь сразу 131K/262K context только потому, что модель это поддерживает.
Для coding agent гораздо важнее:
* стабильность;
* скорость;
* нормальный запас VRAM;
* отсутствие CPU offload.
Оставь хотя бы небольшой запас VRAM для Windows, приложений и CUDA overhead.
Если необходимо, используй подходящую quantization KV cache, например Q8, если она поддерживается текущей версией llama.cpp и помогает держать большой context без заметной потери качества.
Не используй экстремальную KV quantization без необходимости.
## Этап 5. Подними локальный API
После настройки подними локальный OpenAI-compatible сервер.
Желаемый endpoint:
http://127.0.0.1:8080/v1
Сервер по умолчанию должен слушать только localhost.
НЕ открывай его наружу в интернет.
Не создавай firewall rule с публичным доступом.
Создай удобный скрипт запуска, например:
start-qwen38
или подходящий `.bat`, `.ps1`, `.cmd`, `.sh`.
Скрипт должен:
1. запускать Qwen3.8-27B;
2. использовать CUDA;
3. использовать оптимальный quant;
4. использовать найденные оптимальные параметры;
5. поднимать API;
6. не требовать каждый раз вводить длинную команду вручную.
Также создай скрипт остановки при необходимости.
## Этап 6. Проверь реальную загрузку GPU
После запуска обязательно проверь:
nvidia-smi
Определи:
* сколько VRAM заняла модель;
* сколько системной RAM используется;
* происходит ли CPU offload;
* сколько VRAM осталось свободно.
Мне нужен не ответ "должно работать", а фактическая проверка текущей машины.
Если CPU offload происходит — выясни почему.
Если Q5_K_M не помещается нормально:
1. сначала попробуй уменьшить context;
2. проверить KV cache;
3. проверить параметры GPU offload;
4. только затем перейти на Q4_K_M.
## Этап 7. Benchmark
Выполни несколько тестов.
### Test 1 — генерация
Дай модели простой coding prompt примерно на 500–1000 generated tokens.
Измерь:
* prompt processing speed;
* generation speed в tokens/sec;
* VRAM usage;
* RAM usage.
### Test 2 — coding
Попроси модель написать небольшую, но не тривиальную функцию или исправить специально созданную ошибку в коде.
Убедись, что output нормальный и модель корректно работает.
### Test 3 — длинный контекст
Проверь работу хотя бы с 16K–32K context.
Убедись, что нет:
* CUDA OOM;
* внезапного CPU offload;
* падения сервера;
* ошибок template/tokenizer.
## Этап 8. Настрой coding-agent
После успешного запуска самой модели подготовь её для использования как локального coding agent, максимально похожего по workflow на Claude Code.
Предпочтительно используй:
Qwen Code
или другой хорошо поддерживаемый coding harness, если Qwen Code по объективным причинам хуже работает с текущим локальным backend.
Он должен уметь:
* читать repository;
* искать по файлам;
* редактировать файлы;
* создавать новые файлы;
* использовать terminal;
* запускать тесты;
* анализировать ошибки;
* повторно исправлять код;
* работать с Git;
* работать через локальный Qwen3.8-27B API.
Никакие запросы к модели не должны уходить в облачный API.
Настрой coding agent на:
http://127.0.0.1:8080/v1
Не подставляй OpenAI/Anthropic API как fallback.
Если приложение требует API key для OpenAI-compatible endpoint, используй фиктивное локальное значение, если это допустимо.
## Этап 9. Не ломай существующую систему
Очень важно:
* не удаляй Claude Code;
* не меняй его конфигурацию;
* не удаляй мои другие AI tools;
* не меняй глобальные environment variables без необходимости;
* не удаляй CUDA;
* не переустанавливай драйвер NVIDIA без веской причины;
* не меняй системный Python без необходимости;
* не трогай мои проекты;
* не включай модель в Windows Startup автоматически без необходимости.
Если нужен новый PATH entry — добавляй аккуратно.
Перед потенциально разрушительным изменением сначала найди безопасный вариант.
## Этап 10. Создай README
После успешной установки создай файл:
LOCAL_QWEN_README.md
В нём напиши:
### Что установлено
* версия Qwen
* quantization
* размер GGUF
* версия llama.cpp
* путь к модели
### Как запустить
Одна конкретная команда.
### Как остановить
Одна конкретная команда.
### Как запустить coding agent
Одна конкретная команда.
### API
* address
* port
* model name
### Производительность
Запиши реальные результаты тестов:
* model VRAM
* remaining VRAM
* RAM usage
* generation tokens/sec
* prompt processing tokens/sec
* context size
### Конфигурация
Запиши фактические launch parameters.
## Критерий успешного выполнения
Не считай задачу завершённой, пока одновременно не выполнены следующие условия:
* Qwen3.8-27B скачана;
* модель запускается;
* CUDA используется;
* RTX 5090 действительно выполняет inference;
* GPU offload настроен правильно;
* модель не съедает ненужно большую часть 128 GB RAM;
* локальный API отвечает;
* выполнен реальный generation test;
* измерена скорость;
* создан простой способ запуска;
* подготовлен local coding-agent setup;
* создан LOCAL_QWEN_README.md.
Если один способ установки не работает — диагностируй проблему и попробуй другой нормальный способ.
Не останавливайся после первой ошибки.
При этом не маскируй ошибки и не используй костыли, которые значительно ухудшают производительность.
## В конце дай мне краткий отчёт
Покажи:
1. Какая именно версия модели установлена.
2. Q5_K_M или Q4_K_M.
3. Размер модели.
4. Где она находится.
5. Сколько VRAM занимает.
6. Сколько VRAM остаётся.
7. Сколько системной RAM используется.
8. Какой context установлен.
9. Сколько tokens/sec получилось.
10. Как запустить модель одной командой.
11. Как запустить локальный coding agent одной командой.
12. Какие ограничения или проблемы ты обнаружил.
Начинай с диагностики текущей системы, а затем самостоятельно выполняй установку.