SpaceXAI presenta Grok 4.7, su modelo más potente para programación y trabajo de conocimiento
Grok 4.7 mantiene el precio de su antecesor, 2 dólares por millón de tokens de entrada y 6 de salida, y sube a 46,3% en CursorBench 4.0. Queda por debajo de Fable 5.1 en capacidad, pero a una quinta parte de su precio de entrada.

La noticia en 30 segundos
SpaceXAI lanzó Grok 4.7 el 21 de septiembre de 2026, su modelo más capaz para programación y trabajo de conocimiento. Cuesta 2 dólares por millón de tokens de entrada y 6 por millón de salida, el mismo precio que Grok 4.6. Sube de 40,4% a 46,3% en CursorBench 4.0, por encima de GPT-5.6 Sol Max (41,7%) y por debajo de Fable 5.1 Max (51,8%), que cobra 10 y 50 dólares por millón. Está disponible en Cursor, Grok Build, la API de Grok y plataformas cloud.
SpaceXAI publicó Grok 4.7 el 21 de septiembre de 2026 y el titular no es la capacidad, sino la relación entre capacidad y precio. El modelo se sirve al mismo precio y velocidad que Grok 4.6, 2 dólares por millón de tokens de entrada y 6 por millón de salida, mientras sube su desempeño en las pruebas de trabajo largo. La compañía lo posiciona como su modelo más capaz para programación y para lo que llama trabajo de conocimiento, es decir, tareas profesionales de varias horas.
Grok 4.7 parte de un modelo base más grande que el de Grok 4.6 y se entrenó con una corrida de aprendizaje por refuerzo más larga, ponderada hacia problemas que toman horas. Según SpaceXAI, el modelo es mejor verificando su propio trabajo y administrando contextos largos.
¿Qué dicen los benchmarks de Grok 4.7?
En CursorBench 4.0, la prueba que mide tareas de programación de larga duración, Grok 4.7 en configuración xHigh marca 46,3%, contra 40,4% de Grok 4.6 High y 41,7% de GPT-5.6 Sol Max. Fable 5.1 Max sigue arriba con 51,8%.
El resto del cuadro publicado por la empresa muestra un modelo parejo más que dominante:
- DeepSWE v1.1: 71,0% en alto esfuerzo, contra 72,7% de GPT-5.6 Sol Max y 70,0% de Fable 5.1 Max.
- EEBench (ingeniería eléctrica): 64,0%, el mejor del cuadro.
- Terminal-Bench 4.0: 38,0%, muy lejos del 57,9% de Fable 5.1 Max pero casi el doble del 20,3% de Grok 4.6.
- Harvey Legal Agent Benchmark: 19,6%, por encima del 6,7% de Fable 5.1 y del 2,5% de GPT-5.6 Sol.
- HealthBench Professional (razonamiento clínico): 56,7%, por debajo de sus dos competidores.
- GDPval, que mide trabajo profesional real: Elo de 1.695, contra 1.735 de Fable 5.1 y 1.542 de GPT-6 Astra.
La lectura honesta es que Grok 4.7 no lidera la frontera de capacidad. Lidera la frontera de precio por tarea, que es una discusión distinta y, para la mayoría de las empresas en Chile y Latinoamérica, más relevante.
¿Cuánto cuesta Grok 4.7 frente a sus competidores?
La tabla de precios que publicó SpaceXAI deja la brecha a la vista. Grok 4.7 cobra 2 dólares por millón de tokens de entrada y 6 de salida. GPT-5.6 Sol Max cobra 4 y 20. Fable 5.1 Max cobra 10 y 50.
Es decir: por el costo de un millón de tokens de salida de Fable 5.1, se compran más de ocho millones en Grok 4.7. La empresa también sirve una variante rápida, con el doble de velocidad de salida al doble de precio.
Para un equipo comercial que corre agentes sobre volumen de correos, resúmenes de llamadas o enriquecimiento de registros del CRM, esa diferencia no es un detalle técnico: es la diferencia entre un piloto que sobrevive al comité de presupuesto y uno que no.
¿Qué cambió en seguridad?
SpaceXAI afirma haber construido Grok 4.7 con una pila de salvaguardas completamente nueva y lo describe como su modelo más fuerte en resistencia a jailbreak. En HackerBench v0.3, su propia prueba de tareas de ciberseguridad riesgosas, el modelo deja pasar un 3,3% de los prompts de doble uso considerados riesgosos, bloqueando poco el trabajo legítimo de seguridad. También encabeza el benchmark de bioseguridad de LatchBio con 62,4%.
Conviene leer estas cifras con la cautela que corresponde: son pruebas del propio proveedor sobre su propio modelo. Sirven como señal, no como auditoría independiente.
¿Dónde se puede usar hoy?
Grok 4.7 está disponible desde el día del anuncio en Cursor y en Grok Build, además de la API de Grok, harnesses de programación de terceros, enrutadores de modelos y plataformas cloud. Para un equipo en Santiago, Bogotá o Ciudad de México eso significa que no hace falta esperar una habilitación regional: el acceso es por API desde el primer día.
Análisis de Revenue Hub
La noticia que importa para un líder comercial no es que Grok 4.7 esté quinto o segundo en un benchmark. Es que la curva de precio por unidad de capacidad sigue cayendo mientras la capacidad sube. Un modelo que hace hoy lo que hace seis meses costaba cinco veces más cambia qué casos de uso pasan de «interesante» a «rentable». Calificación de leads sobre volumen, resúmenes de llamadas para todo el equipo y no solo para enterprise, limpieza continua del CRM: todos esos casos se vuelven viables cuando el costo por tarea baja un orden de magnitud.
La decisión concreta que esto implica es de arquitectura, no de proveedor. Si tu operación de ingresos está cableada a un solo modelo, cada anuncio como este te deja fuera de la mejora. La postura correcta es enrutar por tarea: modelos baratos y rápidos para el trabajo de volumen (clasificar, extraer, resumir) y reservar el modelo caro para lo que de verdad exige razonamiento largo. Eso exige una capa de orquestación y una métrica de costo por tarea que hoy la mayoría de las empresas en Chile y Latinoamérica no está midiendo.
El riesgo del otro lado es real: los benchmarks de autoevaluación de un proveedor no son evidencia suficiente para mover una operación productiva. Antes de cambiar, corre tu propia evaluación sobre tus datos, con tus prompts y tus criterios de aceptación. Si te interesa cómo estructurar esa capa de decisión, revisa el resto de nuestra cobertura en IA en ventas y los análisis del blog de Revenue Hub.
Fuente y criterio editorial
Revenue Hub resume, contextualiza y analiza esta información para equipos B2B de Chile y Latinoamérica. La publicación original pertenece a SpaceXAI.
Leer la fuente originalPara profundizar
Preguntas frecuentes
¿Cuánto cuesta Grok 4.7 por millón de tokens?
Grok 4.7 cuesta 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida, el mismo precio que Grok 4.6. SpaceXAI también ofrece una variante rápida con el doble de velocidad de salida al doble de precio.
¿Grok 4.7 es mejor que Fable 5.1 o GPT-5.6 Sol?
Depende del criterio. En CursorBench 4.0, Grok 4.7 marca 46,3%, por encima de GPT-5.6 Sol Max (41,7%) y por debajo de Fable 5.1 Max (51,8%). En precio, Grok 4.7 cobra 2 y 6 dólares por millón, contra 4 y 20 de GPT-5.6 Sol y 10 y 50 de Fable 5.1. Grok 4.7 gana en precio por tarea, no en capacidad máxima.
¿Qué cambió entre Grok 4.6 y Grok 4.7?
Grok 4.7 usa un modelo base más grande y se entrenó con una corrida de aprendizaje por refuerzo más larga sobre tareas más difíciles, ponderada hacia problemas de varias horas. Según SpaceXAI, verifica mejor su propio trabajo y administra mejor el contexto largo. Subió de 40,4% a 46,3% en CursorBench 4.0 y de 20,3% a 38,0% en Terminal-Bench 4.0.
¿Dónde está disponible Grok 4.7?
Está disponible desde el 21 de septiembre de 2026 en Cursor y Grok Build, además de la API de Grok, harnesses de programación de terceros, enrutadores de modelos y plataformas cloud. El acceso por API está disponible desde Chile y el resto de Latinoamérica sin habilitación regional previa.
¿Qué tan seguro es Grok 4.7?
SpaceXAI afirma que es su modelo más fuerte en rechazos y resistencia a jailbreak. En su benchmark interno HackerBench v0.3 deja pasar 3,3% de los prompts de doble uso riesgosos, y encabeza el benchmark de bioseguridad de LatchBio con 62,4%. Son pruebas del propio proveedor, no auditorías independientes.
¿Sirve Grok 4.7 para equipos comerciales y de RevOps?
Sirve especialmente para tareas de volumen dentro de la operación de ingresos: clasificar leads, extraer datos, resumir llamadas y limpiar registros del CRM. Su ventaja no es el razonamiento máximo sino el costo por tarea, que es lo que determina si un caso de uso de alto volumen es rentable o no.
¿Conviene migrar toda la operación de IA a Grok 4.7?
No como decisión automática. La arquitectura recomendable es enrutar por tipo de tarea: modelos baratos y rápidos para trabajo de volumen y modelos más caros para razonamiento largo. Antes de mover cualquier flujo productivo conviene correr una evaluación propia con datos, prompts y criterios de aceptación de la empresa.
¿Qué es CursorBench 4.0 y por qué importa?
CursorBench 4.0 es un benchmark que mide tareas de programación de larga duración, es decir, trabajo que exige mantener contexto y verificar resultados durante horas. Importa porque aproxima mejor que las pruebas cortas cómo se comporta un modelo cuando se le delega trabajo real y autónomo dentro de un equipo técnico.




¿Cómo se vive esto en tu equipo?
Participa con tu nombre o un alias. Sin crear una cuenta ni dejar tu correo.
Cargando comentarios…