Apple promete 1.5TB de RAM. Ya corrimos 744B con 25GB
Ricardo Argüello — 25 de julio de 2026
CEO & Fundador
Resumen general
Alex Finn predijo que en dos años Apple va a vender Mac Studios con 1.5 terabytes de RAM y que con 300GB vas a correr inteligencia nivel Opus 4.8 en tu escritorio. Tres días antes de esa publicación, IQ Source ya había corrido un modelo de 744 mil millones de parámetros en una laptop sin GPU con apenas 25GB. La memoria nunca fue el cuello de botella; el rendimiento de inferencia sí lo es, y agregar terabytes no lo resuelve.
- Alex Finn (84.800 vistas) predijo Mac Studios con 1.5TB de RAM en ~2 años, citando un rumor de la cuenta AppleTrack sobre un chip M7 Ultra todavía sin confirmar
- Su cálculo: con ~300GB de esos 1.5TB correrías localmente inteligencia 'nivel Opus 4.8'; concluye que en dos años todo el mundo tendrá un modelo local en su escritorio
- IQ Source ya corrió GLM-5.2, un modelo de 744 mil millones de parámetros, en una laptop sin GPU con apenas 25GB de RAM, una fracción de los 300GB que Finn cree necesarios
- El resultado funciona pero es lento, un token cada 10 a 20 segundos, porque el cuello de botella es leer expertos desde disco en cada paso, no la capacidad de memoria disponible
- Más terabytes de RAM no arreglan ese problema; es una pregunta de ancho de banda y cómputo por token, un problema de ingeniería distinto al que Finn identificó
Imagina que alguien te dice que el tráfico de tu ciudad se va a resolver en dos años porque van a construir un estacionamiento gigante nuevo. El estacionamiento ayuda a guardar más carros, pero si la avenida sigue teniendo un solo carril, sigues atascado igual. Eso es lo que pasa con la predicción de Finn: más RAM te da más espacio para guardar el modelo, pero no ensancha el carril por el que tiene que pasar cada token.
Resumen generado con IA
Alex Finn publicó el 13 de julio un hilo que ya pasó las 84.800 vistas. Su predicción: en unos dos años, Apple va a vender Mac Studios con 1.5 terabytes de RAM, citando un rumor de la cuenta AppleTrack sobre un chip todavía sin anunciar que llaman “M7 Ultra”. Con apenas 300GB de esos 1.5TB, dice Finn, vas a poder correr en tu escritorio “inteligencia nivel Opus 4.8” sin depender de la nube. Su conclusión es contundente: en dos años, todo el mundo en el planeta va a tener un modelo local corriendo en su propio equipo, y hay que empezar a prepararse ya.
Comparto el destino que describe Finn. No comparto la variable que él cree que falta para llegar ahí.
Tres días antes de que escribiera esto, en IQ Source ya habíamos cubierto un experimento que corrió un modelo de 744 mil millones de parámetros en una laptop sin tarjeta gráfica, con apenas 25GB de RAM. No 300GB. Veinticinco. Funcionó, produjo respuestas correctas y coherentes. La memoria nunca fue el obstáculo. El obstáculo real es otra cosa, y agregarle terabytes de RAM a una Mac Studio no la resuelve.
Lo que Finn acertó y lo que confundió
Empiezo por lo que me parece correcto de su hilo, porque no es poco. Finn tiene razón en que la IA corriendo en tu propio hardware, sin depender de una API en la nube, va camino a volverse normal. Tiene razón en que las empresas deberían empezar a pensar en esa posibilidad ahora, no cuando ya sea urgente. Ese instinto es sólido.
Donde se equivoca es en la variable que usa para medir la distancia entre hoy y ese futuro. Su lógica es: más capacidad de RAM, entonces más capacidad de correr modelos grandes, entonces en dos años (cuando salga el hardware con más RAM) todos vamos a tener inteligencia de nivel frontera en el escritorio. Esa cadena de razonamiento asume que la RAM es el límite que hay que superar. Y esa parte del razonamiento ya está probada como incorrecta, no en dos años, sino hoy, con hardware que ya existe.
Lo que dice el rumor que citó
Vale la pena mirar de dónde salió el número. AppleTrack, una cuenta que suele filtrar detalles de la cadena de suministro de Apple, publicó que un chip futuro, apodado “M7 Ultra”, soportaría hasta 1.5TB de memoria unificada. No hay confirmación de Apple. No hay fecha de lanzamiento oficial. Es un rumor de especificaciones, del tipo que circula meses o años antes de que Apple confirme cualquier cosa, si es que lo hace.
Finn tomó ese rumor y le agregó su propia extrapolación: si el chip soporta 1.5TB, y si con 300GB alcanza para correr un modelo del calibre de Opus 4.8 localmente, entonces en dos años cualquiera va a tener eso en su escritorio. Es una cadena de “sis” apilados sobre un rumor de hardware que todavía no existe. Y aunque el chip saliera exactamente como lo describe AppleTrack, el argumento de fondo seguiría sin sostenerse, porque la capacidad de RAM nunca fue la variable que determina si un modelo corre a una velocidad usable.
Lo que ya demostramos con colibrì
El proyecto se llama colibrì, es de código abierto, y lo construyó un desarrollador que publica en Hacker News como vforno. Corre GLM-5.2, un modelo de mezcla de expertos de Zhipu AI con 744 mil millones de parámetros totales, en una laptop de consumo, sin GPU, con 25GB de RAM.
La técnica mantiene residente en memoria solo la porción densa y compartida del modelo, unos 17 mil millones de parámetros cuantizados, que ocupan cerca de 10GB. El resto, cientos de miles de millones de parámetros repartidos en miles de expertos enrutados, se queda en el disco duro y se transmite bajo demanda según lo que necesita cada token. Todo el motor cabe en un archivo de C de unas 2.400 líneas.
Funciona. Produce texto correcto y coherente. Con 25GB, no con 300GB. Eso ya tumba la premisa central de la predicción de Finn: no necesitas terabytes de RAM para correr un modelo de cientos de miles de millones de parámetros. Ya se puede, con una fracción minúscula de lo que él asume necesario.
El cuello de botella real: rendimiento, no capacidad
Ahora la parte incómoda, porque colibrì no es magia gratis. El resultado produce un token nuevo cada 10 a 20 segundos. Eso es aproximadamente lo que tarda leer esta frase completa, palabra por palabra, antes de que aparezca la siguiente. Para un chat de un usuario esperando una respuesta, eso no es usable.
¿Por qué tan lento si “solo” hay que leer datos de disco? Porque en un modelo de mezcla de expertos, el enrutador decide para cada token cuáles expertos activar, de un total de miles disponibles. Casi cada token nuevo necesita un subconjunto distinto de expertos, y la mayoría de esos subconjuntos no están todavía en la caché de RAM. El sistema tiene que ir al disco en casi cada paso, y leer desde disco, aunque sea un SSD rápido, toma órdenes de magnitud más tiempo que leer desde RAM.
Acá está el punto que la predicción de Finn no contempla: si le dieras a colibrì 1.5TB de RAM en vez de 25GB, sí podrías mantener más expertos residentes en memoria a la vez, lo cual ayudaría. Pero no resuelve el problema de fondo, que es cuántos datos puedes mover y procesar por segundo, es decir, ancho de banda de memoria y cómputo, no cuánta memoria total tienes disponible. Es la diferencia entre un estacionamiento más grande y una avenida con más carriles. Ayudan cosas distintas, y solo una de las dos resuelve el atasco de tráfico.
Lo que sí significa para tu empresa
No estoy descartando el destino que describe Finn. La IA corriendo en hardware local, sin depender de una API externa por cada consulta, es una dirección real, y hay razones de costo, privacidad y latencia para que las empresas la tomen en serio. Ya he escrito antes sobre por qué reconocer estos patrones de ciclo tecnológico, la demo que funciona en el laboratorio meses o años antes de que alguien la vuelva confiable y aburrida en producción, es la ventaja real que da la experiencia, no la nostalgia de haber visto la tecnología anterior.
Lo que sí cuestiono es usar una hoja de especificaciones de hardware, un rumor todavía sin confirmar, para poner fecha a ese destino. El cronograma real depende de que alguien resuelva el problema de ancho de banda y cómputo por token en arquitecturas de mezcla de expertos, no de que Apple meta más gigabytes en un chip. Esa es la pregunta que evaluamos primero en el discovery de AI Maestro cuando una empresa nos trae la idea de correr IA en su propio hardware: no cuánta memoria tiene el equipo, sino qué latencia necesita realmente la operación y si la arquitectura del modelo que quieren usar puede sostenerla a ese volumen. Esa pregunta no se responde leyendo un rumor sobre un chip que todavía no existe.
Preguntas Frecuentes
No hay confirmación oficial de Apple. La cifra viene de un rumor publicado por la cuenta AppleTrack sobre un chip llamado 'M7 Ultra' que todavía no existe como producto anunciado. Alex Finn amplificó ese rumor en una predicción propia sobre IA local, no Apple.
Mucha menos de lo que se asume. IQ Source ya corrió GLM-5.2, un modelo de 744 mil millones de parámetros, en una laptop sin GPU usando apenas 25GB de RAM, gracias a una técnica que mantiene en memoria solo la porción densa del modelo y transmite el resto desde disco.
Porque el cuello de botella no es cuánto cabe en memoria, es cuántos datos puedes leer y procesar por cada token que genera el modelo. En arquitecturas de mezcla de expertos, cada token necesita un subconjunto distinto de parámetros, y leer esos datos, no la capacidad total de RAM, es lo que determina la velocidad.
No hay una fecha confiable todavía, porque depende de resolver el ancho de banda de memoria y la eficiencia del cómputo por token, no de cuánta RAM traigan las próximas computadoras. Ese es un problema de ingeniería de inferencia distinto, y su cronograma no se puede leer en una hoja de especificaciones de hardware.
Artículos Relacionados
Colibrì corrió un modelo de 744B parámetros sin GPU
Colibrì corre GLM-5.2, un modelo de 744B parámetros, en una laptop sin GPU y apenas 25GB de RAM. Funciona. Un token cada 10 a 20 segundos no es producción.
El cuello de botella de la IA ya no es escribir código
Business Insider llama parálisis al costo oculto del AI coding. El problema no es la IA: es que genera código más rápido de lo que un equipo puede revisar y mantener.