IA en local sin pagar por consulta: Qwen vs Gemma vs Nemotron y qué PC necesitas

Ilustración de un ordenador compacto ejecutando IA local en un escritorio

Por Redacción Pangea IA · 14 de septiembre de 2026

Instalar una IA en tu ordenador permite hacer consultas sin pagar tokens a un proveedor por cada respuesta. Puedes dedicarla a redactar, resumir o ayudarte con código. La decisión importante es elegir un modelo que encaje con tu equipo y con la calidad que necesitas.

Comparamos Qwen3.5-9B, Gemma 3 12B y Nemotron 3 Nano 30B-A3B, y proponemos dos ordenadores compactos. Son versiones concretas seleccionadas por su disponibilidad descargable, no una clasificación de todos los modelos más recientes. El análisis se basa en documentación: no hemos ejecutado una prueba comparativa ni medido su velocidad en estos PC.

Qué significa realmente no pagar tokens

En una ejecución local, tu ordenador realiza el cálculo. LM Studio permite conversar con modelos descargados, consultar documentos y mantener un servidor local sin conexión a internet. La búsqueda de modelos, las descargas y las actualizaciones sí necesitan red. Funcionamiento sin conexión de LM Studio.

Los tokens siguen existiendo como unidades de procesamiento, pero no generan una factura de API por esas consultas locales. Continúan los costes de equipo, electricidad y mantenimiento. Si conectas un servicio externo de búsqueda, una API o un modelo en la nube, sus condiciones y posibles cargos son independientes.

Los tres modelos y sus diferencias

ModeloPara qué lo probaríamos primeroEntrada y limitación relevante
Qwen3.5-9BRedacción, resúmenes y ayuda general con códigoTexto e imágenes; la aplicación y la descarga deben admitir la función visual.
Gemma 3 12B ITPreguntas sobre textos e imágenes y resúmenesTexto e imágenes, con respuesta en texto; no es la aplicación Gemini.
Nemotron 3 Nano 30B-A3BRazonamiento, programación y proyectos de agentesTexto; esta versión no es Nemotron Nano Omni y requiere bastante más memoria.

Estas orientaciones son editoriales, basadas en las capacidades descritas por Qwen, Google y Nvidia. No implican que un modelo gane en precisión a los otros.

Qwen3.5-9B: un punto de partida manejable

Es un modelo de nueve mil millones de parámetros con capacidades de texto y visión, publicado bajo Apache 2.0. Lo elegiría para una primera prueba doméstica por el tamaño de su versión comprimida. Ficha del modelo Qwen3.5-9B.

La prueba útil sería darle un texto en español que conozcas bien y pedirle un resumen sin añadir datos. Después probaría una tarea de tu trabajo. Antes de comprar un ordenador, conviene comprobar si la respuesta sirve y cuánto tienes que corregir.

Gemma 3 12B: otra opción para textos e imágenes

Google presenta esta variante ajustada para instrucciones como un modelo multimodal y multilingüe. Tiene condiciones de uso propias de Gemma; el acceso a los archivos originales en Hugging Face exige aceptarlas. Ficha y acceso a Gemma 3 12B.

Lo compararía con Qwen usando exactamente el mismo material. Para una imagen, comprobaría si describe lo visible y si reconoce cuándo un detalle no puede leerse. No basta con que genere una explicación convincente.

Nemotron 3 Nano: más memoria para experimentar

La versión elegida combina tareas de razonamiento y conversación. Nvidia indica unos 30.000 millones de parámetros totales y 3.500 millones activos, con español entre los idiomas admitidos. Se distribuye bajo NVIDIA Nemotron Open Model License. Descripción de Nemotron 3 Nano.

Que active solo una parte de sus parámetros en cada paso no hace que todos los pesos restantes desaparezcan de la memoria. Tampoco su origen obliga a utilizar una tarjeta Nvidia: la compatibilidad depende del formato descargado y del programa que lo ejecute.

Lo plantearía como una segunda etapa, especialmente para quien quiera desarrollar asistentes o trabajar con código. Un modelo local por sí solo no incluye todas las herramientas, conexiones y permisos de un agente completo.

Cuánta memoria necesitas

El tamaño del archivo no es el consumo total de memoria. Hay que dejar espacio para el sistema, la aplicación, los datos de la conversación y, cuando corresponda, los componentes de visión. Cuantizar a 4 bits reduce el tamaño de los pesos y puede cambiar la calidad de las respuestas.

Descarga de referenciaTamaño indicado del Q4_K_MMemoria del equipo que planteamos
Qwen3.5-9B — LM Studio Community5,63 GB24–32 GB como objetivo cómodo para empezar.
Gemma 3 12B IT — LM Studio Community7,3 GB24–32 GB, con margen adicional para imágenes y documentos.
Nemotron 3 Nano 30B-A3B — Unsloth24,6 GB48–64 GB; preferimos 64 GB para dejar margen.

Tamaños publicados por los distribuidores de las conversiones: Qwen GGUF, Gemma GGUF y Nemotron GGUF de Unsloth. Comprueba también los archivos auxiliares necesarios para visión. Otras cuantizaciones tienen otros tamaños.

La última columna es una recomendación conservadora de configuración, no un mínimo oficial ni una medición. Está pensada para un usuario, un modelo cargado y un contexto inicial moderado, por ejemplo 4.000–8.000 tokens. Aumentar mucho el contexto o ejecutar varios modelos cambia los requisitos.

Dos ordenadores compactos que valoraría

Equipo propuestoUso previstoQué comprobar
Mac mini M5 Pro · 24 GB · SSD 512 GBQwen y Gemma cuantizados, usando un motor compatible con Apple Silicon.Memoria realmente accesible al modelo, versión del motor y aceleración gráfica.
GMKtec EVO-X2 · Ryzen AI Max+ 395 · 64 GB · SSD 2 TBLos tres modelos por separado, con mayor margen para Nemotron.Controladores, aceleración de la Radeon y reparto de memoria compartida.

La configuración propuesta es el Mac mini M5 Pro con 24 GB de memoria unificada y SSD de 512 GB. Lo planteamos para Qwen3.5-9B y Gemma 3 12B en las versiones cuantizadas citadas, ejecutando un solo modelo y con un contexto moderado. Los 24 GB también los utiliza el sistema, por lo que hay menos margen para documentos grandes y otras aplicaciones. No recomendamos esta configuración para la descarga de Nemotron de 24,6 GB ni afirmamos una velocidad medida. Especificaciones del Mac mini.

Mac mini M5 Pro de 24 GB y SSD de 512 GB: consulta nuestra ficha del producto para IA en local o su oferta en Amazon.

Enlace pagado de Amazon. En calidad de Afiliado de Amazon, Pangea IA obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables, sin coste adicional para ti.

La configuración del EVO-X2 seleccionada en Amazon tiene 64 GB de RAM y SSD de 2 TB. La memoria LPDDR5X está integrada y no es ampliable, por lo que conviene elegir la capacidad al comprar. Tener más memoria permite cargar modelos mayores, pero no garantiza responder más rápido. Especificaciones oficiales del GMKtec EVO-X2.

GMKtec EVO-X2 de 64 GB y SSD de 2 TB: consulta nuestra ficha del producto para IA en local o su oferta en Amazon.

Enlace pagado de Amazon. En calidad de Afiliado de Amazon, Pangea IA obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables, sin coste adicional para ti.

Antes de elegir una oferta, confirma la configuración exacta, la compatibilidad del programa y el coste final para España. Si necesitas monitor, teclado o ratón, inclúyelos en el presupuesto. Las cifras comerciales de potencia para IA no sustituyen una prueba del modelo que vas a usar.

Cómo empezar con LM Studio

Instala LM Studio para tu sistema, revisa sus requisitos y busca el nombre completo del modelo. Elige una conversión compatible como las enlazadas, descarga también el motor necesario y carga un solo modelo. Empieza con una conversación corta antes de añadir archivos grandes.

Para una primera comparación, usa el mismo texto de unas pocas páginas: pide un resumen, tres preguntas cuya respuesta aparezca en él y una cuarta sobre un dato ausente. Comprueba errores, omisiones y si inventa la respuesta que falta. Anota también cuánto tarda en empezar a responder y cuánto en terminar.

Para imágenes, comprueba que la aplicación reconoce el componente visual. Si falla la carga, revisa memoria disponible, formato y versión del motor; reducir el contexto puede ayudar. Una descarga compatible con una aplicación no garantiza idénticas prestaciones en todos los sistemas.

Privacidad y límites del uso local

LM Studio indica que las conversaciones con modelos locales y el procesamiento local de documentos permanecen en el dispositivo. Esa descripción no debe extenderse a cualquier complemento o servicio externo que conectes. Qué operaciones permanecen en local.

Trabajar sin conexión tampoco actualiza el conocimiento del modelo ni elimina sus errores. Para verificar una noticia reciente necesitas fuentes actuales. Para utilizarlo en un negocio, revisa además la licencia de la versión elegida: disponer de los pesos no significa que todas las familias tengan las mismas condiciones.

Para aplicar estas decisiones a documentos de un negocio, consulta nuestro análisis sobre las garantías sobre datos que reclaman NVIDIA y Palantir a los proveedores de IA. Explicamos cómo distinguir conservación, entrenamiento y acceso, y qué revisar al elegir un entorno de trabajo.

¿Compensa comprar un PC para ahorrar en IA?

Empezaría probando el ordenador que ya tienes. Si el modelo resuelve tus tareas, la inversión adicional puede ser pequeña. Comprar un equipo nuevo solo para eliminar una cuota mensual exige hacer cuentas.

Ejemplo hipotético: un ordenador de 1.200 € que sustituya por completo un gasto de 20 € al mes tardaría 60 meses en recuperar ese importe, antes de electricidad y otros costes. Si sigues necesitando la suscripción, ese ahorro no se produce. Estas cifras ilustran el cálculo; no son los precios de los equipos anteriores.

El uso local gana interés cuando lo utilizas con frecuencia, valoras trabajar sin conexión o ya necesitas renovar el ordenador. Para tareas ocasionales, conviene comparar el coste con una suscripción o una API usada de forma moderada.

Qué opción elegiría primero

Para empezar, probaría Qwen3.5-9B y Gemma 3 12B en el equipo disponible. Elegiría según los resultados en mis propios textos e imágenes. Reservaría Nemotron para una necesidad concreta de razonamiento o desarrollo y con memoria suficiente, sin asumir que un modelo mayor siempre responderá mejor.

Puedes ampliar el contexto con nuestra noticia sobre Qwen en local y sus requisitos, que trata una versión distinta. Si prefieres ampliar un ordenador de sobremesa, consulta la ficha de la MSI RTX 5060 Ti de 16 GB: sus 16 GB de memoria gráfica no bastan para alojar íntegramente la cuantización de Nemotron citada aquí.

Imagen: ilustración conceptual creada con IA para Pangea IA; no reproduce un ordenador concreto ni una prueba de rendimiento. Información consultada el 14 de septiembre de 2026.

Recibe las nuevas publicaciones de Pangea IA

Suscríbete gratis y recibe por correo las nuevas noticias, guías y análisis sobre inteligencia artificial.

Respuestas

  1. Avatar de MSI RTX 5060 Ti de 16 GB: una gráfica para ejecutar IA local – Pangea IA

    […] modelo puedes ejecutar en tu ordenador? Consulta nuestra comparativa de Qwen, Gemma y Nemotron para IA en local, con descargas, requisitos de memoria y dos ordenadores compactos. Las necesidades dependen de la […]

    Me gusta

  2. Avatar de Qwen 3.8 en local: requisitos y límites – Pangea IA

    […] modelo puedes ejecutar en tu ordenador? Consulta nuestra comparativa de Qwen, Gemma y Nemotron para IA en local, con descargas, requisitos de memoria y dos ordenadores compactos. Las necesidades dependen de la […]

    Me gusta

  3. Avatar de Mac mini M5 Pro de 24 GB: un ordenador compacto para IA en local – Pangea IA

    […] nuestra comparativa de Qwen, Gemma y Nemotron en local encontrarás las diferencias entre modelos, las necesidades de memoria y la alternativa GMKtec […]

    Me gusta

  4. Avatar de GMKtec EVO-X2 de 64 GB y 2 TB: mini PC para IA en local – Pangea IA

    […] Esta ficha se basa en documentación del fabricante y en la configuración anunciada en Amazon. No hemos probado físicamente el equipo ni medido sus respuestas por segundo. Lo incluimos como la opción con más memoria en nuestra comparativa de Qwen, Gemma y Nemotron para IA en local. […]

    Me gusta

  5. Avatar de El BCE alerta: Europa no puede limitarse a importar IA – Pangea IA

    […] y el debate sobre la IA europea muestran que hay alternativas en desarrollo, mientras que la comparativa de modelos para ejecutar IA en local ilustra que algunas tareas ya pueden resolverse sin pagar cada consulta a una API. Pero «pesos […]

    Me gusta

  6. Avatar de NVIDIA y Palantir exigen más garantías a la IA: qué ocurre con los datos de las empresas – Pangea IA

    […] nuestra comparativa de Qwen, Gemma y Nemotron para usar IA en local explicamos opciones y requisitos. Son versiones concretas para experimentar; enlazarlas aquí no […]

    Me gusta

  7. Avatar de MediaTek estrena su chip de 2 nm para llevar más IA al móvil – Pangea IA

    […] distinción es la misma que explicamos al comparar modelos de IA ejecutados en un ordenador: «local» describe dónde se realiza el cálculo, no garantiza por sí solo privacidad, precisión […]

    Me gusta

  8. Avatar de Euclyd capta más de 200 millones para desarrollar chips de IA en Europa – Pangea IA

    […] tamaño del modelo, privacidad, usuarios simultáneos, consumo, soporte y coste total. Nuestra comparativa de modelos y ordenadores para IA local muestra por qué memoria, software y compatibilidad pesan tanto como el nombre del acelerador. […]

    Me gusta

  9. Avatar de Salesforce y NVIDIA lanzan Koa, una IA especializada en CRM – Pangea IA

    […] eso no debe confundirse con los modelos que una empresa puede ejecutar por su cuenta. En nuestra comparativa de Qwen, Gemma y Nemotron para IA local explicamos qué supone controlar el equipo y el modelo. Koa ofrece otro tipo de control: permanece […]

    Me gusta

  10. Avatar de Huawei prevé 900.000 millones de agentes de IA para 2035 – Pangea IA

    […] tan importante como el precio por millón de tokens. Ejecutar modelos en local, como muestra esta comparativa de IA local sin pago por tokens, puede ser útil en tareas repetitivas, aunque exige hardware y administración […]

    Me gusta

  11. Avatar de Googlebook llega desde 899 dólares: el portátil con Gemini – Pangea IA

    […] También conviene separar la IA en la nube de la IA local. Un Googlebook puede ofrecer una experiencia muy integrada, pero muchas capacidades de Gemini dependen del servicio de Google y de una conexión. Quien priorice privacidad, trabajo sin Internet o modelos ejecutados en el propio equipo debería comparar esa propuesta con un ordenador preparado para ejecutar IA local sin pagar por cada consulta. […]

    Me gusta

  12. Avatar de Altar-1: la IA de ciberseguridad que funciona en local – Pangea IA

    […] concepto encaja con el interés creciente por la IA local, que permite procesar información sin pagar por cada consulta ni enviarla continuamente a …. La diferencia es la escala. Mientras que algunos modelos domésticos caben en un ordenador […]

    Me gusta

  13. Avatar de EmbeddingGemma 2: Google lleva la IA multimodal al dispositivo – Pangea IA

    […] que ya analizamos en Pangea IA: ejecutar más inteligencia artificial cerca del usuario. En nuestra comparativa de Qwen, Gemma y Nemotron para IA local explicamos las ventajas y límites de procesar modelos sin depender continuamente de servicios […]

    Me gusta

Deja una respuesta