¿Cómo funciona la IA local?
Es sencillo. Para utilizar IA en local necesitamos cargar un modelo en la memoria RAM utilizando nuestra CPU. Si nuestra RAM es mayor que el tamaño del modelo, podremos trabajar con él porque cabe perfectamente:
Sin embargo, no todo es tan sencillo. Empecemos hablando de los tamaños de los modelos.
Tamaños de los modelos
Existen modelos de IA de distintos tamaños, desde unos ~150MB (los más pequeños) hasta modelos masivos de 500GB o más. Aunque hay modelos fuera de nuestro alcance, como estos últimos, existen modelos de todo tipo. Si nuestro hardware tiene recursos limitados, sólo podemos optar a utilizar modelos más pequeños. Sin embargo, cuanto más grande es el modelo, más «inteligente» y capaz tiende a ser.
El tamaño del modelo se mide en B, una unidad que representa cuantos billions (mil millones) de parámetros tiene el modelo:
El problema radica en que los modelos de IA suelen ocupar varios GB de tamaño, y cargarlos desde la RAM, si bien es posible, resulta bastante lento. Sin embargo, nuestros dispositivos cuentan con un tipo de memoria mucho más rápida y adecuada para esto: la VRAM, es decir, Video RAM, la memoria de la tarjeta gráfica.
Usar la memoria de nuestra GPU es ideal para ejecutar estos modelos, ya que es la más rápida (puede transmitir un mayor caudal de información). Sin embargo, esta memoria es costosa y, por lo general, no contamos con tarjetas gráficas con demasiada VRAM. Aquí es donde entra en juego la cuantización de los modelos.
Cuantización de los modelos
Los modelos de IA almacenan una gran cantidad de información en formato numérico. Cuando hablamos de modelos cuantizados, nos referimos a que esta información numérica se reduce continuamente en precisión, almacenando menos información, reduciendo el tamaño, pero inevitablemente perdiendo exactitud y calidad en los resultados.
Tenemos múltiples niveles de cuantización:
Generalmente, se considera que las cuantizaciones cercanas a Q4 ofrecen un buen equilibrio entre calidad y tamaño. Cuanto más agresiva sea la cuantización de un modelo (número más bajo), más pequeño será su tamaño en GB y más probable será que quepa en nuestro hardware al ejecutarlo.

