Ir al contenido principal

Entradas

Mostrando las entradas etiquetadas como llama

Llama.cpp en Linux con modelo local y servicio systemd

Servidor Llama.cpp en Linux con modelo local 1. Estructura de directorios Organiza todo bajo /opt/llama-app : /opt/llama-app/ ├── bin/ # Ejecutables compilados de llama.cpp │ └── llama-server └── models/ # Modelos de lenguaje └── Meta-Llama-3-8B-Instruct.Q4_K_M.gguf 2. Levantar el servidor manualmente cd /opt/llama-app/bin ./llama-server \ -m /opt/llama-app/models/Meta-Llama-3-8B-Instruct.Q4_K_M.gguf \ --host 0.0.0.0 \ --port 9000 \ --ctx-size 4096 \ --n-gpu-layers 0 3. Probar la API Desde la misma máquina: curl http://127.0.0.1:9000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Meta-Llama-3-8B-Instruct.Q4_K_M", "messages": [ {"role": "system", "content": "Eres un asistente útil en español."}, {"role": "user", "content": "Explícame qué es la inteligencia ...

Docker y Llama.cpp: imagen con modelo y servidor compilados

Guía Completa: Crear un Servidor de Llama.cpp con Docker Incluyendo el Modelo En este tutorial te mostraré cómo configurar un servidor de Llama.cpp utilizando Docker, con la particularidad de que el modelo de lenguaje se incluirá dentro de la imagen Docker. Requisitos Previos Docker instalado en tu sistema Al menos 8 GB de espacio libre en disco 4 GB de RAM como mínimo Conexión a Internet estable (para descargar el modelo) Nota: La construcción de la imagen puede tardar entre 30-60 minutos debido al tamaño del modelo (4.58 GB). Paso 1: Crear el Directorio de Trabajo Copiar mkdir -p /home/docker/llama-server cd /home/docker/llama-server Paso 2: Crear el Archivo Dockerfile Crea un archivo llamado Dockerfile con el siguiente contenido: Copiar FROM ubuntu:22.04 # Instalar dependencias necesarias para compilar ...

Instalar llama.cpp, Ubuntu 24.4

Guía Completa: Ejecutar Modelos LLM Locales con llama.cpp Esta guía te muestra cómo ejecutar modelos de lenguaje grandes (LLM) localmente usando binarios precompilados de llama.cpp, sin necesidad de GPU. Requisitos Previos Sistema Linux (Ubuntu/Debian recomendado) Al menos 8GB de RAM (16GB recomendado para modelos grandes) Conexión a Internet para descargar binarios y modelos Conocimientos básicos de terminal 📂 Paso 1: Preparar el entorno Descargar binarios precompilados Crea un directorio y descarga los binarios precompilados de llama.cpp: Copiar # Crear directorio principal mkdir ~/llama-app cd ~/llama-app # Descargar binarios precompilados wget https://github.com/ggml-org/llama.cpp/releases/download/b6111/llama-b6111-bin-ubuntu-x64.zip # Descomprimir y organizar unzip llama-b6111-bin-ubuntu-x64.zip mv build llama.cpp # Renombrar carpeta cd llama.cpp/bin # Acceder a los e...