En los últimos años, el ecosistema de la Inteligencia Artificial en local ha experimentado una auténtica revolución. Sin embargo, la gran mayoría de optimizaciones y herramientas populares suelen centrarse casi de manera exclusiva en ecosistemas NVIDIA (CUDA) o en el silicio unificado de Apple (Metal).
¿Qué ocurre con los millones de equipos, portátiles y mini-PCs equipados con procesadores Intel y gráficas integradas Intel Iris Xe, Intel Arc o la nueva generación Intel Core Ultra? Hay una enorme capacidad de cómputo desaprovechada en escritorios de desarrollo y servidores edge.
Para resolver esta fricción y democratizar la inferencia local eficiente en hardware común, he creado y publicado como Open Source OVM (OpenVINO Model Manager).

Ejecutar modelos de lenguaje grandes (LLMs) de forma nativa en arquitecturas Intel suele toparse con tres barreras importantes:
OVM (OpenVINO Model Manager) es una herramienta integral en CLI/TUI acompañada de un servidor de inferencia de alto rendimiento compatible con la API de OpenAI, impulsado bajo el capó por Intel® OpenVINO™ GenAI.
El objetivo principal es reducir a cero la fricción: te permite explorar un catálogo curado de modelos pre-cuantizados en INT4 (como Qwen 2.5, Llama 3.2, Phi-3.5 o Mistral), descargarlos con un solo clic, monitorizar la velocidad de inferencia en tiempo real y servirlos en segundo plano con soporte para cambio en caliente (hot-switching).
╭───────────── OVM - OpenVINO Model Manager ─────────────╮
│ Gestor de modelos locales acelerados por Intel Iris Xe │
╰────────────────────────────────────────────────────────╯
● Servidor ACTIVO: OpenVINO/Qwen2.5-Coder-3B-Instruct-int4-ov en GPU
Opciones:
1. 📋 Listar modelos instalados
2. 🔍 Buscar y explorar catálogo de modelos
3. 📥 Descargar un nuevo modelo (Pull)
4. 🔄 Cambiar modelo activo en el servidor (Use)
5. 💬 Chat rápido en terminal con benchmarks
6. 🚀 Iniciar / Reiniciar servidor
7. 🛑 Detener servidor
8. 🗑️ Eliminar modelo de la caché
0. 🚪 Salir
/v1): Funciona directamente como backend sustitutivo para clientes como AnythingLLM, Open WebUI, Continue.dev (VS Code), Chatbox y librerías como LangChain o el SDK oficial de OpenAI.La instalación está totalmente automatizada mediante un instalador que configura un entorno virtual dedicado y deja el comando ovm disponible en tu entorno de usuario:
# Clonar el repositorio
git clone https://github.com/xtoxico/openvino-model-manager.git
cd openvino-model-manager
# Ejecutar el instalador automático
./install.sh
Una vez completada la instalación, solo tienes que lanzar el gestor:
ovm
Desde el menú TUI puedes descargar tu modelo preferido y levantar el servicio en http://127.0.0.1:8000/v1.
Basta con configurar el endpoint en tus herramientas habituales:
{
"api_base": "http://127.0.0.1:8000/v1",
"model": "OpenVINO/Qwen2.5-Coder-3B-Instruct-int4-ov"
}
El proyecto está disponible bajo licencia MIT y abierto a la comunidad. Si trabajas con inferencia en el Edge, modelos optimizados o buscas exprimir el rendimiento de tu hardware Intel en local, te invito a probarlo, abrir incidencias o enviar PRs.