
Lo que sí está documentado, y lo que casi nunca le cuentan completo.
Esta página reúne la evidencia incómoda. Cada cifra conserva su fuente y cada caso aparece entero, incluidas las partes que suelen quedarse fuera de la presentación de ventas.
Los cuatro despliegues industriales mejor documentados del mundo
No son pilotos anunciados. Son operaciones con fecha de arranque, escala verificable y cifras publicadas por las propias empresas.
Robots humanoides insertando piezas de chapa en el ensamble de chasis, en turnos de diez horas de lunes a viernes. Diez meses de operación: más de 90,000 componentes, cerca de 1.2 millones de pasos de proceso y unas 1,250 horas, en la producción de más de 30,000 vehículos. Lo reportó su consejo de producción en febrero de 2026. La segunda fase arrancó en junio de 2026, ahora en secuenciado logístico.
Treinta y seis cámaras sobre una barra de 120 pies distinguen maleza de cultivo en tiempo real y disparan boquillas individuales. Escanea más de 2,500 pies cuadrados por segundo a 24 kilómetros por hora. En 2024 cubrió un millón de acres con 59% de ahorro de herbicida. En 2025 llegó a cinco millones de acres y cerca de 31 millones de galones ahorrados.
Cámaras de 24 megapíxeles capturan mil imágenes por vagón en 360 grados, con el tren circulando a 113 kilómetros por hora, y unos cuarenta algoritmos detectan defectos. Desde septiembre de 2025 opera un segundo portal en Georgia que inspecciona 19 trenes diarios.
Trenes de carga totalmente autónomos: 940 millones de dólares de inversión, 200 locomotoras, más de 1,700 kilómetros de vía, 16 minas y 4 puertos. Acumula más de un millón de kilómetros recorridos sin conductor. El proyecto se hizo con un compromiso público de cero despidos.

Anunciar es rápido. Publicar una cifra, no.
Meses transcurridos entre el anuncio del proyecto y la primera cifra de resultado publicada.
Lo que no cruza el umbral no se compra
Dan Florness, director general de Fastenal, lo dijo en la llamada de resultados del 15 de julio de 2026: muchas compañías hablan de inteligencia artificial, y ellos no hablan mucho de eso, simplemente hacen un montón de cosas detrás de escena.
Detrás de la frase hay un umbral, no una pose. Fastenal evalúa cada inversión en inteligencia artificial contra una sola pregunta: si sube la productividad de la plantilla entre 5% y 10%, sobre una base de costo laboral de mil seiscientos millones de dólares al año. Lo que no cruza ese umbral no se compra. Si usted no tiene un umbral así, todavía no está evaluando: está explorando.

Lo que sí está documentado, y lo que casi nunca le cuentan completo.
Cuatro despliegues industriales documentados, el tiempo real hasta la primera cifra publicada y las dos advertencias que casi nadie cuenta completas.
El piloto siempre rinde más que la escala
Los dos casos que más se citan en presentaciones son también los dos que peor se cuentan.
En 2024, con un millón de acres, reportó 59% de ahorro de herbicida. En 2025, con cinco millones de acres, cerca de 50%. Al quintuplicar la superficie, el beneficio unitario cayó nueve puntos. Y su promesa de lanzamiento en 2022 había sido más de dos tercios: el resultado de campo quedó diecisiete puntos por debajo del anuncio.
Febrero de 2024: su asistente atiende dos tercios de los chats, el trabajo equivalente a 700 agentes. Mayo de 2025: vuelven a contratar humanos. Noviembre de 2025: suben la cifra a 853 agentes equivalentes y 60 millones de dólares ahorrados, y en el mismo trimestre su costo de servicio sube de 42 a 50 millones. Su director general lo explicó en Bloomberg el 8 de mayo de 2025: como el costo parece haber sido un factor de evaluación demasiado predominante, lo que terminas teniendo es menor calidad.
Las dos cifras son reales. Las dos historias completas dicen otra cosa. Pida siempre la versión con las dos fechas.
Acertar una vez no es acertar siempre
Cualquiera puede probar una herramienta de conversación y quedar impresionado. Casi todo el entusiasmo del último año viene de esa prueba de cinco minutos. La pregunta de negocio no es si acierta, es si acierta todas las veces. Un proceso de negocio no se corre ocho veces hasta que salga bien: se corre una.
| Cómo se le exige al modelo | Acierto de los mejores modelos |
|---|---|
| Un intento, una tarea | 60% |
| Ocho veces seguidas la misma tarea | 25% |
| Una sola pregunta | 58% |
| Conversación de varios turnos | 35% |

Lo que estas pruebas no miden
En la misma prueba, todos los modelos evaluados entregaron información que debían proteger en más del 99% de los intentos, cuando no se les dio instrucción explícita de no hacerlo. De ahí sale el principio de diseño que separa un sistema serio de una demostración impresionante: que el modelo lea la intención, y que la decisión de negocio la tome la regla, contra datos reales.
La primera advertencia es de juicio propio. En un ensayo controlado, desarrolladores expertos resultaron 19% más lentos usando asistencia de inteligencia artificial, y aun así creyeron que los había acelerado, según METR, 2025, vía Stanford HAI.
La segunda es de alcance, y es importante. Las pruebas t-bench y CRMArena-Pro están construidas sobre casos estadounidenses y en inglés. No existe evidencia pública de cómo se degradan estos sistemas operando en español, y extrapolar es suposición.
Lavado de agentes, y tres preguntas sin escape
Anushree Verma, analista senior de Gartner, lo dijo el 25 de junio de 2025: muchos proveedores están contribuyendo al ruido con lo que llaman lavado de agentes. De los miles de proveedores que hoy se anuncian con inteligencia artificial, Gartner estima que unos 130 lo son de verdad, y el resto renombró asistentes de conversación y flujos que ya vendía antes. La misma firma proyecta que más del 40% de los proyectos de esta categoría se cancelarán antes de que termine 2027, y 42% de las empresas ya está descartando la mayoría de sus iniciativas, arriba del 17% del año anterior.
- Arme una prueba con trescientas de mis cotizaciones reales y córrala delante de mí, antes de firmar
Un proveedor serio ya tiene un banco de pruebas y acepta construir el suyo con datos de usted. El que enseña una demostración preparada, no. Stanford midió tres productos que se anunciaban como libres de invención y encontró que inventaban entre 17% y 33% de las veces. La única prueba que vale es la que se corre con datos de usted.
- ¿Cuál es el número de hoy, quién lo midió, y con qué grupo lo va a comparar?
Si el éxito se va a medir con una encuesta de satisfacción o con horas ahorradas que la gente reporta a mano, no se va a medir. Sin línea base tomada antes y sin grupo de comparación, cualquier cifra posterior es una impresión bien presentada.
- ¿En qué condiciones me recomendaría no comprarle?
Es barata de hacer e imposible de fingir. Quien sabe implementar sabe decir a quién no le sirve. La respuesta le dice más sobre el proveedor que toda la presentación anterior.
De dónde salió cada cifraSalas de prensa de BMW Group, John Deere, Norfolk Southern, Rio Tinto y Klarna. Reconstrucción propia sobre salas de prensa corporativas, agosto de 2026. Llamada de resultados de Fastenal, 15 de julio de 2026. Bloomberg, 8 de mayo de 2025, y resultados del tercer trimestre de 2025 de Klarna. Pruebas públicas t-bench y CRMArena-Pro, 2025. METR, 2025, vía Stanford HAI. Gartner, comunicado del 25 de junio de 2025. S&P Global Market Intelligence, más de mil respondientes.
Lo que sigue en el informe.
You've got this.
Agende su demo y vea con su propio catálogo lo que este capítulo describe.