Appearance
Ollama Runner
Описание
runner-ollama — раннер для выполнения запросов к Ollama API для работы с LLM-моделями. Поддерживает режимы generate (генерация текста) и chat (диалог).
Возможности
- Генерация текста (generate) и чат (chat) с LLM-моделями
- Стриминг ответов в реальном времени
- Настройка параметров генерации (temperature, top_p, top_k, max_tokens)
- Выбор модели через переменные задач
- Системные промпты для chat-режима
- Статистика использования (токены, скорость, время)
Конфигурация
Общие параметры runner-common
См. Общая документация.
Ollama-specific параметры
Флаги командной строки
| Флаг | Описание | По умолчанию |
|---|---|---|
--ollama-url | URL Ollama API | http://localhost:11434 |
--ollama-model | Модель по умолчанию | llama3.2 |
--ollama-temperature | Температура генерации (0-1) | 0.7 |
--ollama-max-tokens | Максимум токенов для генерации | 2048 |
--ollama-top-p | Top P sampling (0-1) | 0.9 |
--ollama-top-k | Top K sampling | 40 |
--ollama-stream | Включить стриминг | false |
--ollama-timeout | Таймаут запроса (секунды) | 120 |
Переменные окружения
| Переменная | Описание |
|---|---|
OLLAMA_BASE_URL | URL Ollama API |
OLLAMA_MODEL | Модель по умолчанию |
OLLAMA_TEMPERATURE | Температура генерации |
OLLAMA_MAX_TOKENS | Максимум токенов |
OLLAMA_TOP_P | Top P sampling |
OLLAMA_TOP_K | Top K sampling |
OLLAMA_STREAM | Стриминг (true/false) |
OLLAMA_TIMEOUT | Таймаут запроса (сек) |
YAML конфигурация
yaml
url: "https://app.com/"
token: "your-token"
concurrency: 2
# Ollama параметры
base_url: "http://localhost:11434"
model: "llama3.2"
temperature: 0.7
max_tokens: 2048
top_p: 0.9
top_k: 40
stream: true
timeout: 120Переменные задач
| Переменная | Описание |
|---|---|
OLLAMA_MODEL | Модель для использования (переопределяет конфиг) |
OLLAMA_MODE | Режим: generate или chat (по умолчанию: generate) |
OLLAMA_SYSTEM_PROMPT | Системный промпт для chat-режима |
OLLAMA_TEMPERATURE | Температура для данного запроса |
OLLAMA_MAX_TOKENS | Максимум токенов для данного запроса |
Режимы работы
Generate (по умолчанию)
Простая генерация текста по промпту:
Command: "Расскажи интересный факт о космосе"Chat
Диалоговая форма с системным промптом:
Command: "Какая погода сегодня?"
Variables:
OLLAMA_MODE: "chat"
OLLAMA_SYSTEM_PROMPT: "Ты помощник, который отвечает на русском языке"Стриминг
При stream: true ответ выводится по мере генерации:
yaml
stream: trueВключает стриминг для более отзывчивого интерфейса.
Статистика
После выполнения запроса выводится статистика:
Stats: Prompt tokens: 150, Response tokens: 250, Duration: 2.3s, Speed: 108.7 tokens/sПримеры использования
Базовый запуск
bash
export URL="https://your-server.com"
export TOKEN="your-token"
export OLLAMA_BASE_URL="http://localhost:11434"
export OLLAMA_MODEL="llama3.2"
./runner-ollamaЧерез конфиг
bash
./runner-ollama -config config.yamlГенерация кода
Command: "Напиши функцию на Go для сортировки массива"
Variables:
OLLAMA_MODEL: "codellama"Чат с контекстом
Command: "Объясни мне принцип работы Docker"
Variables:
OLLAMA_MODE: "chat"
OLLAMA_SYSTEM_PROMPT: "Ты senior DevOps инженер. Отвечай подробно и с примерами."
OLLAMA_TEMPERATURE: "0.3"Требования
- Ollama должен быть запущен и доступен по указанному URL
- Модель должна быть скачана:
ollama pull llama3.2 - Для других моделей:
ollama pull <model_name>
Поддерживаемые модели
Любые модели, доступные в Ollama:
llama3.2(по умолчанию)llama3.1codellamamistralmixtralphi3gemma- И другие
Остановка
Корректно обрабатывает SIGINT и SIGTERM. Текущие запросы отменяются.