Servidor Llama.cpp en Linux con modelo local 1. Estructura de directorios Organiza todo bajo /opt/llama-app : /opt/llama-app/ ├── bin/ # Ejecutables compilados de llama.cpp │ └── llama-server └── models/ # Modelos de lenguaje └── Meta-Llama-3-8B-Instruct.Q4_K_M.gguf 2. Levantar el servidor manualmente cd /opt/llama-app/bin ./llama-server \ -m /opt/llama-app/models/Meta-Llama-3-8B-Instruct.Q4_K_M.gguf \ --host 0.0.0.0 \ --port 9000 \ --ctx-size 4096 \ --n-gpu-layers 0 3. Probar la API Desde la misma máquina: curl http://127.0.0.1:9000/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "Meta-Llama-3-8B-Instruct.Q4_K_M", "messages": [ {"role": "system", "content": "Eres un asistente útil en español."}, {"role": "user", "content": "Explícame qué es la inteligencia ...