Saltar al contenido principal

Apple promete 1.5TB de RAM. Ya corrimos 744B con 25GB

Alex Finn predice Mac Studios con 1.5TB de RAM en 2 años para IA local. IQ Source ya corrió 744B parámetros con 25GB, sin GPU. La RAM no era el problema.

Apple promete 1.5TB de RAM. Ya corrimos 744B con 25GB

Ricardo Argüello

Ricardo Argüello
Ricardo Argüello

CEO & Fundador

Desarrollo de Software 6 min de lectura

Alex Finn publicó el 13 de julio un hilo que ya pasó las 84.800 vistas. Su predicción: en unos dos años, Apple va a vender Mac Studios con 1.5 terabytes de RAM, citando un rumor de la cuenta AppleTrack sobre un chip todavía sin anunciar que llaman “M7 Ultra”. Con apenas 300GB de esos 1.5TB, dice Finn, vas a poder correr en tu escritorio “inteligencia nivel Opus 4.8” sin depender de la nube. Su conclusión es contundente: en dos años, todo el mundo en el planeta va a tener un modelo local corriendo en su propio equipo, y hay que empezar a prepararse ya.

Comparto el destino que describe Finn. No comparto la variable que él cree que falta para llegar ahí.

Tres días antes de que escribiera esto, en IQ Source ya habíamos cubierto un experimento que corrió un modelo de 744 mil millones de parámetros en una laptop sin tarjeta gráfica, con apenas 25GB de RAM. No 300GB. Veinticinco. Funcionó, produjo respuestas correctas y coherentes. La memoria nunca fue el obstáculo. El obstáculo real es otra cosa, y agregarle terabytes de RAM a una Mac Studio no la resuelve.

Lo que Finn acertó y lo que confundió

Empiezo por lo que me parece correcto de su hilo, porque no es poco. Finn tiene razón en que la IA corriendo en tu propio hardware, sin depender de una API en la nube, va camino a volverse normal. Tiene razón en que las empresas deberían empezar a pensar en esa posibilidad ahora, no cuando ya sea urgente. Ese instinto es sólido.

Donde se equivoca es en la variable que usa para medir la distancia entre hoy y ese futuro. Su lógica es: más capacidad de RAM, entonces más capacidad de correr modelos grandes, entonces en dos años (cuando salga el hardware con más RAM) todos vamos a tener inteligencia de nivel frontera en el escritorio. Esa cadena de razonamiento asume que la RAM es el límite que hay que superar. Y esa parte del razonamiento ya está probada como incorrecta, no en dos años, sino hoy, con hardware que ya existe.

Lo que dice el rumor que citó

Vale la pena mirar de dónde salió el número. AppleTrack, una cuenta que suele filtrar detalles de la cadena de suministro de Apple, publicó que un chip futuro, apodado “M7 Ultra”, soportaría hasta 1.5TB de memoria unificada. No hay confirmación de Apple. No hay fecha de lanzamiento oficial. Es un rumor de especificaciones, del tipo que circula meses o años antes de que Apple confirme cualquier cosa, si es que lo hace.

Finn tomó ese rumor y le agregó su propia extrapolación: si el chip soporta 1.5TB, y si con 300GB alcanza para correr un modelo del calibre de Opus 4.8 localmente, entonces en dos años cualquiera va a tener eso en su escritorio. Es una cadena de “sis” apilados sobre un rumor de hardware que todavía no existe. Y aunque el chip saliera exactamente como lo describe AppleTrack, el argumento de fondo seguiría sin sostenerse, porque la capacidad de RAM nunca fue la variable que determina si un modelo corre a una velocidad usable.

Lo que ya demostramos con colibrì

El proyecto se llama colibrì, es de código abierto, y lo construyó un desarrollador que publica en Hacker News como vforno. Corre GLM-5.2, un modelo de mezcla de expertos de Zhipu AI con 744 mil millones de parámetros totales, en una laptop de consumo, sin GPU, con 25GB de RAM.

La técnica mantiene residente en memoria solo la porción densa y compartida del modelo, unos 17 mil millones de parámetros cuantizados, que ocupan cerca de 10GB. El resto, cientos de miles de millones de parámetros repartidos en miles de expertos enrutados, se queda en el disco duro y se transmite bajo demanda según lo que necesita cada token. Todo el motor cabe en un archivo de C de unas 2.400 líneas.

Funciona. Produce texto correcto y coherente. Con 25GB, no con 300GB. Eso ya tumba la premisa central de la predicción de Finn: no necesitas terabytes de RAM para correr un modelo de cientos de miles de millones de parámetros. Ya se puede, con una fracción minúscula de lo que él asume necesario.

El cuello de botella real: rendimiento, no capacidad

Ahora la parte incómoda, porque colibrì no es magia gratis. El resultado produce un token nuevo cada 10 a 20 segundos. Eso es aproximadamente lo que tarda leer esta frase completa, palabra por palabra, antes de que aparezca la siguiente. Para un chat de un usuario esperando una respuesta, eso no es usable.

¿Por qué tan lento si “solo” hay que leer datos de disco? Porque en un modelo de mezcla de expertos, el enrutador decide para cada token cuáles expertos activar, de un total de miles disponibles. Casi cada token nuevo necesita un subconjunto distinto de expertos, y la mayoría de esos subconjuntos no están todavía en la caché de RAM. El sistema tiene que ir al disco en casi cada paso, y leer desde disco, aunque sea un SSD rápido, toma órdenes de magnitud más tiempo que leer desde RAM.

Acá está el punto que la predicción de Finn no contempla: si le dieras a colibrì 1.5TB de RAM en vez de 25GB, sí podrías mantener más expertos residentes en memoria a la vez, lo cual ayudaría. Pero no resuelve el problema de fondo, que es cuántos datos puedes mover y procesar por segundo, es decir, ancho de banda de memoria y cómputo, no cuánta memoria total tienes disponible. Es la diferencia entre un estacionamiento más grande y una avenida con más carriles. Ayudan cosas distintas, y solo una de las dos resuelve el atasco de tráfico.

Lo que sí significa para tu empresa

No estoy descartando el destino que describe Finn. La IA corriendo en hardware local, sin depender de una API externa por cada consulta, es una dirección real, y hay razones de costo, privacidad y latencia para que las empresas la tomen en serio. Ya he escrito antes sobre por qué reconocer estos patrones de ciclo tecnológico, la demo que funciona en el laboratorio meses o años antes de que alguien la vuelva confiable y aburrida en producción, es la ventaja real que da la experiencia, no la nostalgia de haber visto la tecnología anterior.

Lo que sí cuestiono es usar una hoja de especificaciones de hardware, un rumor todavía sin confirmar, para poner fecha a ese destino. El cronograma real depende de que alguien resuelva el problema de ancho de banda y cómputo por token en arquitecturas de mezcla de expertos, no de que Apple meta más gigabytes en un chip. Esa es la pregunta que evaluamos primero en el discovery de AI Maestro cuando una empresa nos trae la idea de correr IA en su propio hardware: no cuánta memoria tiene el equipo, sino qué latencia necesita realmente la operación y si la arquitectura del modelo que quieren usar puede sostenerla a ese volumen. Esa pregunta no se responde leyendo un rumor sobre un chip que todavía no existe.

Preguntas Frecuentes

Apple M7 Ultra Mac Studio IA local inferencia en dispositivo ancho de banda de memoria colibrì AI Maestro

Artículos Relacionados

Colibrì corrió un modelo de 744B parámetros sin GPU
Desarrollo de Software
· 6 min de lectura

Colibrì corrió un modelo de 744B parámetros sin GPU

Colibrì corre GLM-5.2, un modelo de 744B parámetros, en una laptop sin GPU y apenas 25GB de RAM. Funciona. Un token cada 10 a 20 segundos no es producción.

colibrì GLM-5.2 Mixture of Experts
El cuello de botella de la IA ya no es escribir código
Desarrollo de Software
· 6 min de lectura

El cuello de botella de la IA ya no es escribir código

Business Insider llama parálisis al costo oculto del AI coding. El problema no es la IA: es que genera código más rápido de lo que un equipo puede revisar y mantener.

AI coding revisión de código deuda cognitiva