On-prem LLM на GPU для финансовой компании
Финтех / LLM Infrastructure LLM on-prem GPU vLLM Python Docker
Latency: 400ms на запрос.
## Задача
Финансовая компания хотела использовать LLM для анализа документов и внутреннего поиска, но данные не могли покидать контур — ни в OpenAI, ни в облако.
## Решение
Развернул GPU-сервер (NVIDIA A100): установка CUDA, Docker, vLLM, квантизация Mistral 7B и Llama 3. Fine-tuning на внутренних документах (договоры, регламенты). RAG-пайплайн с pgVector. API-совместимый с OpenAI — интеграция в существующие сервисы без переписывания.
## Результат
Latency: 400ms на запрос. Стоимость запроса: в 40x дешевле GPT-4. 100% данных внутри контура. 8 внутренних сервисов подключены к LLM через единый API за 2 недели.