Guia Completa de LLMs a l'Edge amb Raspberry Pi

  • Implementació de models de llenguatge petits (SLMs) i models de visió-llenguatge (VLMs) per a processament local.
  • Optimització de maquinari mitjançant lús de Raspberry Pi 5, refrigeració activa i emmagatzematge NVMe.
  • Ús d'eines com Ollama i Llama.cpp per executar models quantitzats en format GGUF.
  • Integració d'IA a la vora per a aplicacions de domòtica, seguretat industrial i anàlisi de dades privades.

IA a Raspberry Pi

Segur que us heu preguntat si és possible tenir un cervell artificial potent sense dependre que els servidors d'una gran empresa als Estats Units estiguin operatius. La resposta és un rotund sí, ia més, avui dia córrer models de llenguatge en un dispositiu tan compacte com una Raspberry Pi ha deixat de ser un experiment per a friquis i ha esdevingut una opció tècnica viable i sorprenentment eficient.

La màgia passa gràcies a la computació a la vora o informàtica de vora, que bàsicament consisteix a processar la informació just on es genera. En moure la IA al dispositiu, aconseguim que la privadesa de les dades sigui absoluta, ja que res surt de casa, i eliminem aquesta latència desesperant que passa quan les dades han de viatjar milers de quilòmetres abans de rebre una resposta.

importància actualitzacions ota a iot-2
Article relacionat:
Open source a IoT: plataformes, dades i edge AI que marquen la diferència

El maquinari ideal per a la IA local

Si vols ficar-te a aquest jardí, no et serveix qualsevol placa. La Gerd Pi 5 és la candidata perfecta gràcies al seu processador Arm Cortex-A76, que és una autèntica bèstia per gestionar tasques d'inferència. Perquè l'experiència no sigui una tortura, és fonamental comptar amb el model de 8GB de RAM, ja que els models quantitzats consumeixen una quantitat considerable de memòria RAM i el sistema operatiu necessita aire per respirar.

Un punt on molta gent fica la pota és la temperatura. La inferència de LLMs posa els nuclis al 100%, cosa que provoca que el processador s'escalfi quickest. Per evitar que el sistema baixi el rendiment pel estrangulació tèrmica, el Active Cooler oficial no és un accessori opcional, és obligatori. Si no vols que el teu Pi es converteixi en una torradora, necessites aquesta ventilació activa.

Pel que fa a l'emmagatzematge, encara que una targeta microSD de classe A2 compleix, si vols que els models carreguin en un obrir i tancar d'ulls, l'ideal és fer servir un NVMe-SSD mitjançant un HAT M.2. La diferència és abismal: carregar un model de 2GB pot passar de 12 segons a tan sols 3 o 4, cosa que accelera el desplegament de qualsevol aplicació a la vora.

Arm amplia el programa de llicències d'IA
Article relacionat:
Arm amplia Flexible Access per a llicències d'IA a l'edge

Entenent els SLMs i la quantificació

Oblida't d'intentar executar GPT-4 en una Raspberry; seria com voler ficar un elefant en un cotxe compacte. Aquí entren en joc els Models de llenguatge petit (SLM). Aquests models, que solen tenir entre uns pocs centenars de milions i uns 7 o 8 mil milions de paràmetres, estan dissenyats específicament per a dispositius amb recursos limitats sense perdre gaire coherència.

El truc mestre perquè això funcioni és la quantificació GGUF. Bàsicament, consisteix a reduir la precisió dels pesos del model (per exemple, de 16 bits a 4 bits). Això fa que el model ocupi molt menys espai a RAM i que la velocitat de generació de tokens sigui acceptable, permetent assolir ritmes de lectura còmodes per a un humà.

  • Truca 3.2 (1B i 3B): Ideals per a diàlegs multilingües i tasques de resum.
  • Gemma 3 i 3n: Destaquen per la seva eficiència i, en algunes versions, capacitats visuals.
  • Microsoft Phi-3.5: Molt potent en raonament, encara que de vegades pot pecar de ser massa verbós.
  • TinyFlama: El rei de la velocitat, perfecte per a ordres simples de domòtica.

Eines de desplegament: Ollama i Flama.cpp

Per posar tot això en marxa, tenim dos camins principals. D'una banda, Truca.cpp és lopció per als qui volen control total. Permet compilar el codi font optimitzant les instruccions ARM NEON i dotprod, fet que esprem cada gota de potència del silici. És ideal per exposar una API compatible amb OpenAI al port 8080 i connectar la Pi amb altres dispositius de la xarxa local.

D'altra banda, tenim Ollama, que és probablement la forma més senzilla de gestionar models avui dia. Amb un parell d'ordres a la terminal, pots descarregar i executar models com Truca o Gemma sense complicacions. Ollama aixeca un servidor en segon pla que permet interactuar amb la IA mitjançant una llibreria de Python molt intuïtiva, facilitant la creació de scripts personalitzats.

Per optimitzar el sistema, especialment en versions Lite de Raspberry Pi OS, és vital augmentar l'espai de swap a uns 4GB. Això evita que el procés sigui aniquilat per l'OOM Killer (Out Of Memory) quan el model i el context del xat comencen a omplir la memòria RAM disponible.

agents de la local a esp32
Article relacionat:
Agents d'IA local a ESP32: frameworks, projectes i límits

Models de Visió i Llenguatge (VLMs) a la vora

La cosa es posa realment interessant quan barregem la vista amb la paraula. Els Vision-Language Models (VLMs) permeten que la Raspberry Pi no només llegeixi, sinó que entengui imatges. Models com Moondream són sorprenentment ràpids i capaços de descriure escenes, comptar objectes o realitzar OCR directament al dispositiu.

Un exemple pràctic i molt potent és lús de la Raspberry Pi AI Camera. En lloc d'enviar el vídeo brut al núvol, la càmera processa la imatge al sensor i genera metadades (com etiquetes d'objectes i nivells de confiança). Aquestes dades lleugeres s'envien al LLM, que les converteix en resums llegibles per a humans. És la diferència entre enviar un vídeo de 1GB o un text de 1KB.

Aquest enfocament obre la porta a aplicacions com el monitoratge de prestatgeries en retail, on el sistema avisa si falta estoc, o la vigilància a fàbriques per comprovar si els operaris porten posat el equip de seguretat, tot això mantenint la privadesa i complint la normativa GDPR en no pujar imatges a servidors externs.

Casos d'ús reals i automatització

Si et mola la domòtica, pots convertir el teu Pi en un centre de control local. Imagina un assistent de veu que utilitzi Whisper.cpp per transcriure la teva veu i un LLM local per parsejar la intenció en un JSON que després dispari accions a Home Assistant. Tot això passa en mil·lisegons i sense connexió a internet.

En entorns industrials, aquests sistemes poden servir per al manteniment predictiu o loptimització de processos en temps real. També són or pur per a l'agricultura de precisió, on un dispositiu mòbil pot analitzar la salut dels cultius al mig del camp sense necessitat de tenir cobertura 5G.

Des d'eines educatives a zones remotes fins a assistents per a persones amb discapacitat, la capacitat d'executar IA generativa a l'edge democratitza l'accés a la tecnologia i permet crear solucions hiperespecialitzades que no depenen d'una quota mensual de subscripció al núvol.

Tenir la capacitat de processar llenguatge i visió de manera local en una placa de 80 euros és un salt tecnològic brutal. Combinant maquinari optimitzat, models quantitzats i eines com Ollama, qualsevol desenvolupador pot muntar un ecosistema de IA privada, ràpida i eficient que realment sigui útil al món físic.

edgecortix-sakura-ii IA
Article relacionat:
EdgeCortix SAKURA-II Edge AI accelerador d'IA amb 60 TOPS i només 8W

Afegir com a font preferida a Google