OVM: Gestor y Servidor de Modelos IA Locales para Intel

Python OpenVINO Intel AI CLI Open Source FastAPI

ovm

OVM — OpenVINO Model Manager

Gestor de modelos locales y servidor API OpenAI-compatible optimizado para hardware Intel.

OVM es una herramienta ligera en CLI/TUI y un servidor de inferencia de alto rendimiento diseñado para simplificar la descarga, gestión y ejecución de Modelos de Lenguaje Grande (LLMs) en local, aprovechando al máximo la aceleración de hardware mediante el toolkit Intel® OpenVINO™ GenAI.


🎯 La Visión: Democratizar la IA local en Hardware Intel

A diferencia de la mayoría de herramientas optimizadas exclusivamente para GPUs NVIDIA (CUDA) o chips Apple Silicon, OVM está diseñado para extraer el máximo rendimiento de los millones de procesadores con gráficas integradas Intel Iris Xe, GPUs dedicadas Intel Arc y procesadores Intel Core Ultra. Permite transformar portátiles, mini-PCs y servidores edge en potentes nodos de inferencia local sin configuraciones complejas.

✨ Características Principales

  • 🏎️ Aceleración Hardware Nativa: Inferencia optimizada en GPU integrada (Iris Xe / Arc) y extensiones vectoriales CPU multihilo.
  • 🌐 API Compatible con OpenAI (/v1): Funciona como sustituto directo (drop-in replacement) para herramientas como Continue.dev, Open WebUI, AnythingLLM, Chatbox o librerías como LangChain.
  • 🔄 Hot Model-Switching: Permite cambiar el modelo activo en memoria en caliente desde la terminal o mediante llamadas a la API sin necesidad de reiniciar el servidor ni desconectar a los clientes.
  • 📊 Benchmarking en Streaming: Terminal interactivo con métricas en tiempo real que mide tokens por segundo (tok/s), latencia al primer token (TTFT) y uso de recursos.
  • 📦 Catálogo INT4 Calibrado: Pesos pre-calibrados para maximizar la velocidad y reducir al mínimo el consumo de RAM y VRAM compartida.

🏗️ Stack Tecnológico y Arquitectura

Componente Tecnología Rol en el Proyecto
Motor de Inferencia Intel® OpenVINO™ GenAI Compilación y ejecución acelerada en hardware Intel.
Capa de Servicio API FastAPI + Uvicorn Endpoints asíncronos (/v1/chat/completions, /v1/models).
Interfaz de Usuario Rich & TUI interactiva Menús interactivos, paneles y chat interactivo en consola.
Formato de Modelos OpenVINO IR (INT4) Representación intermedia cuantizada de baja memoria.
Distribución Bash / Python venv Script de instalación automática para Linux.

📦 Modelos Soportados en Catálogo

El gestor incluye soporte directo para descarga y despliegue rápido de pesos optimizados en INT4:

  • Qwen 2.5: 0.5B, 1.5B, 3B, 7B (Instruct y Coder)
  • Llama 3.2: 1B, 3B Instruct
  • Phi-3.5: Mini Instruct
  • Mistral: 7B Instruct v0.3

🚀 Instalación e Inicio Rápido

# 1. Clonar el repositorio
git clone https://github.com/xtoxico/openvino-model-manager.git
cd openvino-model-manager

# 2. Ejecutar instalador automático
./install.sh

# 3. Lanzar interfaz
ovm

Una vez levantado el servidor local en http://127.0.0.1:8000/v1, cualquier cliente compatible con la API de OpenAI puede conectarse directamente.


Explorar Repositorio en GitHub

Entrada Anterior