ManzGPU

Bases de la IA local

Hype-Generator 3000™: It's a game-changer

Primeros pasos para entender como funciona la Inteligencia Artificial local, que es un modelo, sus parámetros, etc.

¿Cómo funciona la IA local?

Es sencillo. Para utilizar IA en local necesitamos cargar un modelo en la memoria RAM utilizando nuestra CPU. Si nuestra RAM es mayor que el tamaño del modelo, podremos trabajar con él porque cabe perfectamente:

MODELO IA MEMORIA RAM

Sin embargo, no todo es tan sencillo. Empecemos hablando de los tamaños de los modelos.

Tamaños de los modelos

Existen modelos de IA de distintos tamaños, desde unos ~150MB (los más pequeños) hasta modelos masivos de 500GB o más. Aunque hay modelos fuera de nuestro alcance, como estos últimos, existen modelos de todo tipo. Si nuestro hardware tiene recursos limitados, sólo podemos optar a utilizar modelos más pequeños. Sin embargo, cuanto más grande es el modelo, más «inteligente» y capaz tiende a ser.

El tamaño del modelo se mide en B, una unidad que representa cuantos billions (mil millones) de parámetros tiene el modelo:

35B 5B 2B 1B
RAM COMPUTER

El problema radica en que los modelos de IA suelen ocupar varios GB de tamaño, y cargarlos desde la RAM, si bien es posible, resulta bastante lento. Sin embargo, nuestros dispositivos cuentan con un tipo de memoria mucho más rápida y adecuada para esto: la VRAM, es decir, Video RAM, la memoria de la tarjeta gráfica.

2B MEMORIA RAM
2B MEMORIA GPU

Usar la memoria de nuestra GPU es ideal para ejecutar estos modelos, ya que es la más rápida (puede transmitir un mayor caudal de información). Sin embargo, esta memoria es costosa y, por lo general, no contamos con tarjetas gráficas con demasiada VRAM. Aquí es donde entra en juego la cuantización de los modelos.

Cuantización de los modelos

Los modelos de IA almacenan una gran cantidad de información en formato numérico. Cuando hablamos de modelos cuantizados, nos referimos a que esta información numérica se reduce continuamente en precisión, almacenando menos información, reduciendo el tamaño, pero inevitablemente perdiendo exactitud y calidad en los resultados.

Tenemos múltiples niveles de cuantización:

12B   Q1 > 12B   Q4 > 12B   FP

Generalmente, se considera que las cuantizaciones cercanas a Q4 ofrecen un buen equilibrio entre calidad y tamaño. Cuanto más agresiva sea la cuantización de un modelo (número más bajo), más pequeño será su tamaño en GB y más probable será que quepa en nuestro hardware al ejecutarlo.