El "share of voice" de la voz no dejará de crecer.
Europa obliga desde hoy a que las máquinas se identifiquen, justo cuando habían aprendido a sonar como personas. Entre tanto, la voz IA se ha convertido en la interfaz que compra, atiende y resuelve.
Alexa cumplirá doce años y hasta hace pocas semanas, en España servía apenas para poner música y apagar las luces. La distancia entre esa Alexa y los sistemas de voz que existen hoy y que interpretan una intención mal expresada, mantienen el contexto, consultan un contrato en tiempo real, ejecutan la gestión completa y aguantan que les interrumpan a media frase, se ha conseguido en el último año. La voz ha dejado de ser la promesa no cumplida en 2014, para convertirse en la interfaz desde la que una máquina entiende la intención de una persona y actúa en su nombre.
Y esto ocurre a la par que hoy, 2 de agosto, empieza a aplicarse el artículo 50 del reglamento europeo de inteligencia artificial, que obliga a advertir al cliente de que habla con una máquina, con sanciones de hasta quince millones de euros o el 3% de la facturación global. Justo cuando toda la ingeniería de estos últimos años buscaba que el interlocutor no note la diferencia: latencias por debajo del segundo, arquitecturas nativas de voz a voz, interrupciones sin silencios incómodos, muletillas sintéticas que simulan escucha activa.
Al mismo tiempo, la confianza en el canal se erosiona además por el otro extremo. El fraude por voz sintética creció un 475% en aseguradoras y un 149% en banca en un solo año, y la biometría vocal que se desplegó como defensa se ha convertido en la vía de entrada. En sistemas donde la huella de voz es la llave, una voz clonada es una copia operativa de esa llave. La conversación alcanza su madurez técnica sin que tengamos resuelto quién habla al otro lado.
Un 9,4 de satisfacción atendiendo con una máquina que se presenta como máquina.
Uno de los casos más avanzados de atención al cliente por voz artificial en España se presentó en el encuentro sobre IA agéntica que el Foro IA celebró hace unas semanas en la sede de Good Rebels. Naturgy ha desplegado agentes de voz en su línea de asistencia técnica y más del 50% de las llamadas se resuelven ya sin intervención humana, y se han fijado el objetivo de llegar al 90% a final de año. Según ellos, la satisfacción declarada durante las primeras semanas de funcionamiento fue de 9,4 sobre 10. Terrel Sheridan nos contó que algunos clientes no se creían que estaban hablando con una máquina.
El agente verifica la identidad mediante códigos de un solo uso, consulta contratos y coberturas en tiempo real, ejecuta diagnósticos guiados para averías de calderas y electrodomésticos, y escribe toda la interacción en los sistemas nativos de la compañía. Está entrenado para detectar frases críticas como “olor a gas” y transferir de inmediato a un operador humano.
Y la compañía informa al cliente de que le atiende una inteligencia artificial, con salida a un humano en cualquier momento, cumpliendo con la normativa que se activa ahora.
Detrás hay tres años de fontanería previa: migración de la base de clientes a una plataforma nueva, consolidación de productos, gobierno del dato. Ciento treinta casos de uso desplegados en el grupo. La lectura para cualquier dirección de experiencia de cliente resulta incómoda para los plazos habituales de un comité: la capa conversacional funciona cuando debajo hay sistemas que el agente puede leer y escribir sin fricción.
La aritmética de los sistemas de voz en atención al cliente está cambiando rápidamente.
La barrera entre una conversación aceptable y el rechazo del cliente tiene mucho que ver con el concepto de latencia, el tiempo que pasa entre pregunta y respuesta. Una pausa larga antes de responder rompe la naturalidad y encarece el contacto. El umbral de tolerancia se sitúa en torno a los 2,5 segundos, según el responsable de agentes de IA de NiCE, proveedor de software de atención al cliente para Toyota, Allianz o Nestlé.
Opus 4.7 tarda más de cuatro segundos en emitir el primer token y cuesta 18,5 veces más que Gemini 3 Flash, que ronda el segundo y genera además cuatro veces más tokens por segundo. Anthropic dispone de un modelo más rápido que el de Google, Opus 4.6 Flash, pero su precio actual es cien veces el de Gemini. Los modelos pequeños de OpenAI ganan terreno entre los clientes de NiCE por baratos y veloces.
Pero la velocidad no lo es todo. Los modelos de Anthropic cometen la mitad de errores que Gemini 3 Flash. Con un coste por contacto de 1,84 dólares en autoservicio tradicional (FAQs, IVR, …) frente a 13,5 en canales asistidos por agentes humanos, el coste de los modelos de IA más caros posiblemente no justifique los errores. Un sistema que se equivoca el doble necesita reconocer el doble de veces que está fallando, a mitad de frase, y transferir la llamada (handoff) con todo el contexto.
La disyuntiva entre rapidez y criterio empieza a resolverse por composición. GPT-Live, lanzado el 8 de julio y ya activo por defecto en ChatGPT Voice, escucha y habla simultáneamente, sostiene interrupciones a media frase y delega en un modelo de frontera cuando la pregunta exige búsqueda o razonamiento, manteniendo la conversación viva mientras el trabajo pesado ocurre por detrás. Un modelo veloz en primera línea y uno potente en la retaguardia. No está disponible aún vía API, pero es evidente que el futuro ya está aquí, sólo que no distribuido de manera uniforme.
Bruselas aplaza casi todo menos la obligación de confesar.
El Ómnibus digital sobre IA, en vigor desde el 27 de julio, retrasa el grueso de las obligaciones para sistemas de alto riesgo hasta diciembre de 2027 y agosto de 2028. La supervisión humana obligatoria, la documentación técnica y la evaluación de conformidad se han movido. La transparencia del artículo 50 no.
Europa ha concedido tiempo para casi todo excepto para la obligación de que una máquina diga que lo es. Los sistemas generativos ya comercializados disponen hasta diciembre para incorporar marcado legible por máquina en sus salidas, prórroga técnica que no afecta al aviso al usuario.
La industria se está adelantando a esa exigencia con la misma mano con la que construye la ilusión. La actualización del 31 de julio de OpenAI incorpora marca de agua al audio generado por sus modelos de voz y abre una vía de verificación de procedencia para que terceros puedan comprobarla. Un día antes de que el artículo 50 entre en aplicación, el proveedor que mejor ha resuelto la naturalidad conversacional publica la infraestructura para desmontarla.
El movimiento tiene sentido más allá del cumplimiento. El 86% de los responsables de contact center sitúa el fraude por voz sintética entre sus principales preocupaciones y el 66% no confía en poder detectarlo. Cuando el audio deja de ser prueba de identidad, la verificación se desplaza a la infraestructura: códigos de un solo uso, señales de dispositivo, procedencia criptográfica del propio audio. Naturgy no autentica por voz por la misma razón por la que declara que su agente es una IA.
El 84,7% que dice preferir humanos y el 9,4 que puntúa a una máquina.
La automatización avanza mientras el consumidor declara lo contrario. El 76% de los centros de atención opera ya con humano en el bucle, la IA absorbe el volumen alto y de juicio bajo, y el agente humano conserva el 91% de las interacciones complejas o cargadas emocionalmente. El 84,7% de los consumidores dice preferir a una persona, y el 80,1% sigue prefiriéndola incluso cuando se le garantiza que la IA resolverá su problema.
Estos datos se citan a menudo como veredicto pero funcionan mejor como diagnóstico. El mismo cuerpo de encuestas recoge que el 51% prefiere un bot cuando busca respuesta inmediata, que el 92% de las empresas registra mejora de satisfacción tras implantar IA, y que el autoservicio tradicional sólo resolvía por completo el 14% de las interacciones. Dos décadas de árboles de voz que obligaban a repetir el número de contrato cuatro veces explican en cierto sentido parte del rechazo acumulado.
Lo que la aversión declarada mide, entonces, es la memoria de una experiencia mala más que una objeción de fondo a la máquina. El 9,4 de Naturgy se obtuvo en una línea telefónica donde el cliente sabía que hablaba con una IA. La resistencia no desaparece por sonar más humano, se disuelve cuando el problema queda resuelto en una llamada.
Comprar sin pantalla, sin clic y sin salir de la conversación.
Fuera del contact center, la voz ha entrado en la parte del funnel de cliente que le interesa a las áreas de marketing. Amazon presentó en Cannes Lions un formato publicitario que lleva al comprador del anuncio a la compra dentro de la propia conversación hablada, sin clic ni segunda pantalla, en pruebas sobre dispositivos con pantalla y con una lista corta de anunciantes. En mayo unificó su asistente de compra en una única capa agéntica que responde, recomienda y ejecuta la transacción. La compañía sostiene que sus usuarios de Alexa+ hablan el doble con el asistente y completan el triple de compras en dispositivo.
Por otro lado, ElevenLabs cerró en el primer trimestre una ronda de 500 millones de dólares a valoración de 11.000, y Deepgram levantó 130 millones, lo que podría indicar que el mercado está invirtiendo en la voz como plataforma: una capa transversal, con su propia economía. Quien la controle cobrará peaje a todo lo que se monte por encima.
El comercio electrónico por voz cambiará algunas reglas, igual que lo hará el eCommerce agéntico. Un asistente que recomienda un producto y ejecuta la compra necesita leer la ficha antes: código de producto, medidas, compatibilidades, disponibilidad real. Si esos campos faltan o están mal, el catálogo no entra en la comparación y la marca desaparece de la conversación sin que nadie lo registre en ningún panel. Alrededor del 60% de los catálogos de comercio electrónico arrastra códigos GTIN ausentes o atributos inconsistentes. De nuestra experiencia trabajando en el ámbito del eCommerce, el fichero de producto lo mantiene un equipo pequeño, sin presupuesto propio y recursos muy escasos. Pero esto empieza a cambiar.
Lo que la escritura le ganó al habla no lo devuelve una mejora de latencia.
Durante quince años los sistemas de reconocimiento de voz han dado lugar a multitud de chistes (los dos escoceses en el ascensor es un clásico). La voz era la tecnología que funcionaba a salto de mata. Pero los sistemas de voz actuales nos harán olvidar una etapa que está llegando a su fin, dando paso una nueva era más cercana al ordenador de la nave de Star Trek.
Pero, ¿hasta dónde llegará como interfaz humano máquina la voz que sí funciona? ¿Hablaremos a la máquina de café? ¿Iremos por la calle conversando con unos auriculares al estilo de Her? ¿Dictaremos todo por voz en la oficina?
Puede que la voz sea menos utilizada de lo que parece evidente, por motivos ajenos a la calidad del sistema. Hay varios estudios sobre por qué la gente sigue preferiendo teclear que señalan dos constantes: la privacidad (nadie dicta el número de su tarjeta en el metro), y la costumbre (cuarenta años de teclado no se abandonan por una mejora de latencia). La usabilidad y ergonomía de la voz sobre la escritura es un tema interesante: se habla a ciento cincuenta palabras por minuto y se teclea a cincuenta, una ventaja considerable que la pantalla neutraliza en cuanto la tarea exige densidad, comparación o verificar un dato concreto.
La voz fue la interfaz por defecto de la especie humana durante prácticamente toda nuestra existencia. La escritura le arrebató una parte enorme del territorio desde hace relativamente muy poco, cuando la alfabetización masiva se generalizó en apenas dos siglos. Ganó porque hace cosas que el habla no puede: permanece, se revisa, es silenciosa, es densa, se recorre con la vista y permite acceso aleatorio en lugar de padecerse en acceso secuencial. Ninguna de esas ventajas desaparece porque la máquina haya aprendido a hablarnos y entendernos con naturalidad.
La predicción más razonable parece ser que la voz recupere el terreno que perdió frente a la mala tecnología, que es mucho, y no el que perdió frente a la escritura: las manos ocupadas en la cocina o en un taller, el coche, la calle en ocasiones, el hogar en silencio, las consultas donde preguntar es más rápido que leer, hablar en lugar de buscar combinaciones de botones en electrodomésticos. Y por supuesto, en las llamadas de atención al cliente, que siempre fue una conversación y llevaba años disfrazada de formulario telefónico.
OpenAI apuesta por la lectura ambiciosa con un dispositivo sin pantalla que ya se ha retrasado a 2027. Nosotros apostamos porque cada cual es cada quien con sus manías y sus interfaces varias y porque el vídeo no mató a la estrella de la radio. De lo que no cabe duda, es de que el “share of voice” de la voz no va a dejar de crecer.
La próxima edición de Rebel Intel no llegará hasta el 30 de agosto. Aprovecharemos la pausa veraniega para leer ficción y desarrollar la empatía :)
Fernando y Carlos.
Rebel Intel es una publicación de Good Rebels, agencia y consultora de marketing digital. Si quieres mantenerte al día sobre marketing y comunicación, más allá del impacto que la inteligencia artificial tiene en estas disciplinas, seguramente te interese suscribirte a Rebel Thinking, nuestro newsletter más veterano.
Una muestra de las últimas publicaciones de Rebel Thinking:
CEO, presidentes y LinkedIn: los datos detrás de una voz propia.
Las sucursales bancarias de la inteligencia artificial (sobre nuestro último estudio GEO de la banca en España).
Más allá del algoritmo: La cultura como eje de tu estrategia en TikTok.
Actualidad.
El lanzamiento de Kimi K3 de Moonshot generó un revuelo similar al que en su día causó DeepSeek, al convertirse en un modelo de código abierto (realmente de pesos abiertos) que iguala en rendimiento a GPT 5.5 y Opus 4.8. Alibaba anunció Qwen 3.8, tan potente que solo lo supera Fable 5 de Anthropic. Pero Ben Thompson nos recuerda que estos modelos no necesariamente son más baratos que los propietarios, porque requieren más tokens para resolver un problema (la métrica clave no es el coste por token, sino la eficiencia al generar “inteligencia fungible”). LINK
Y precisamente, Sarah Friar, CFO de Open AI, plantea que calcular el coste de la IA con el precio del token o las licencias es una métrica obsoleta. El valor real está en el coste total necesario para completar con éxito una tarea útil, frente al coste que suponen los reintentos, las latencias y la revisión humana cuando el sistema falla. Un modelo avanzado y más costoso puede resultar más rentable si ejecuta un trabajo complejo de forma fiable en un solo intento. OPEN AI
Después del grave incidente de seguridad que sufrió Hugging Face (que solo se pudo contener con un modelo de código abierto, GLM 5.2), Nvidia, junto con Microsoft, Cisco, Adobe, IBM, Red Hat y Hugging Face, encabeza el lanzamiento de la Open Secure AI Alliance: desarrollará y distribuirá herramientas de seguridad open source para que cualquier equipo de ciberdefensa pueda utilizarlas. También funcionará como lobby para evitar que los gobiernos restrinjan por defecto el acceso al código abierto en modelos de frontera. LINK
Y miles de investigadores de laboratorios IA firman una petición para desacelerar el desarrollo de la tecnología, mientras imaginamos cómo prevenir futuros incidentes no deseados. PACING THE FRONTIER
Substack va a implementar una función para que los lectores puedan escanear un texto y averiguar en qué porcentaje ha sido creado con IA. Substack no se opone al uso de la IA, pero quiere dar a los lectores herramientas de transparencia. También dará a los autores la opción de explicar su proceso creativo, analizar sus borradores e impugnar escaneos erróneos. SUBSTACK
Ramp ha creado una aplicación que dirige cada tarea al LLM óptimo. Con ella ha logrado rebajar un 30% la factura de la IA, y ahora la pone a disposición pública. LINK
En China está surgiendo un mercado de alquiler de rostros para microdramas y anuncios creados con IA, ante la oleada de uso no autorizado de identidades en vídeos sintéticos. LINK
Reflexiones.
Ethan Mollick actualiza su lista de qué modelo usar para cada tarea. Para necesidades cotidianas o de bajo riesgo, los modelos gratuitos son suficientes; para asuntos complejos, analíticos o profesionales, recomienda las versiones de pago de ChatGPT o Claude. Mollick aconseja tratar a la IA como a un empleado al que se le delega trabajo, y recuerda que es más importante gestionar, supervisar y corregir los resultados que redactar prompts perfectos. ONE USEFUL THING
Usamos mucho Claude para redactar en este newsletter. Pero gastamos casi el mismo tiempo que antes editando y encontrando nuestro estilo porque el suyo nos genera rechazo. Y estamos seguros de que se nos pasan dejes y que a veces, nos estamos contagiando incluso cuando redactamos sin IA. ¿Por qué la IA generativa abusa de las fórmulas “No es X, es Y” y “No sólo X, sino Y”? En el proceso de RHLF los humanos tienden a calificar mejor estas expresiones porque transmiten una falsa sensación de matiz y razonamiento profundo. Y también porque responden a la propia naturaleza predictiva de los LLMs: el modelo suelta primero un adjetivo obvio para luego rematar con uno más impactante. Aunque otros tics verbales se ha ido corrigiendo, este persiste porque los nuevos modelos se entrenan con textos generados por otras IA, creando un bucle de retroalimentación (y el riesgo de sonar como un bot si alguien utiliza esas expresiones espontáneamente). THE ATLANTIC
El economista David Deming explica que la auténtica ventaja competitiva de los humanos está en nuestra eficiencia de aprendizaje. Mientras la IA aprende mediante fuerza bruta, las personas hemos sido moldeadas por la evolución para comprimir información e inferir patrones complejos a partir de muestras muy reducidas (sparse data). Esto nos otorga una ventaja decisiva en tareas de “alto contexto”, cambiantes y no verificables mediante código, como las interacciones sociales y las relaciones interpersonales. LINK
Los centros de datos consumieron el año pasado alrededor del 1,5% de la electricidad mundial, y los dedicados específicamente a IA apenas el 0,5%, lo que sitúa a la inteligencia artificial entre el 0,1% y el 0,2% del consumo de energía primaria. La proyección para 2030 lleva el conjunto al 3%. El problema, sin embargo, no es el agregado sino la concentración geográfica: en Irlanda los centros de datos superan el 20% del consumo eléctrico nacional, y en Virginia (USA) pasan de una cuarta parte. OUR WORLD IN DATA
Investigación.
La IA está redefiniendo los roles laborales mediante el task crossover. El 43,5 % de las peticiones a ChatGPT tienen que ver con tareas que antes se derivaban a otros departamentos (marketing resolviendo incidencias web o vendedores analizando datos). El fenómeno sucede especialmente en empresas pequeñas y en las áreas de atención al cliente, diseño o recursos humanos, con más del 65% de sus consultas tocando otras disciplinas. OPEN AI
Un estudio de Bridgewater AIA Labs y Thinking Machines explora cómo enseñar a los LLMs a replicar el criterio de inversores expertos en tareas de triaje y filtrado de información financiera. Aunque estas tareas son cotidianas para los analistas, resultan complejas para las IAs comerciales, pero el experimento logró reducir casi un 30% los errores respecto al mejor modelo comercial y disminuir los costes de inferencia 13.8 veces. El estudio concluye que el futuro de la IA financiera reside en la inteligencia diferenciada: modelos personalizados que aprenden el criterio interno de cada organización. LINK
El análisis de Google de cómo se usa Gemini a gran escala confirma lo que dicen otras encuentras: la adopción es enorme, pero superficial. Vamos, que es lógico que a la gente “de la calle” le cueste entender el poder transformador de la IA. GOOGLE
Tres de cada diez empleados estadounidenses (el 30 %) utilizan la inteligencia artificial en el trabajo varias veces a la semana o más. El apoyo de los responsables es el principal factor que impulsa su adopción generalizada. GALLUP
MCX (mkt, comms y cx).
Hemos entrevistado a Iván Hernández, head of Search & Media en Good Rebels. El posicionamiento en motores generativos sigue siendo, por ahora, un reflejo del SEO tradicional: en banca, seguros, hoteles o telco, las marcas más visibles en la IA son las que ya dominaban los buscadores antes de los LLM. La diferencia está en otro sitio. Los modelos otorgan tanto peso a determinadas fuentes que dejan de consultar el resto en cuanto encuentran allí lo que buscan, de modo que la partida se juega en identificar ese puñado de fuentes hiperrelevantes para cada modelo, no en acumular menciones. Gemini se apoya masivamente en YouTube; ChatGPT alterna entre citar fuentes externas e ignorarlas para responder desde su base interna, según el sector. GOOD REBELS
Relacionado: desde aquí os podéis descargar 4 informes GEO en España que hemos publicado en las últimas semanas: Aseguradoras, Banca, Hospitality y Telecomunicaciones. GOOD REBELS
Meta está construyendo una capa de “intereses latentes” para predecir compra sin tener datos reales de compra. Intenta vincular a usuarios y productos en un mismo mapa, que alimenta pasando el texto, las imágenes y el vídeo del catálogo por modelos de lenguaje y visión. Aprende de patrones agregados y de lo que sabe del producto por su contenido, y así puede vender optimización a conversión con muchos menos datos individuales de los que necesitaba antes. META
Parece que el comercio agéntico llegará primero al carrito de reposición semanal, donde la decisión es menos relevante, y tardará más en entrar en las categorías donde se construye margen. Un estudio de Nuvei sitúa la compra de alimentación a la cabeza de lo que el consumidor confiaría a una IA, con un 28%, seguida de los básicos del hogar (21%) y la renovación de suscripciones (19%). La confianza se desploma en cuanto sube el importe o la implicación: 9% en reservas de viaje y apenas 6% en artículos de lujo o productos financieros. LINK
Y relacionado con el tema de hoy: McDonald’s y Wendy’s amplían sus sistemas de pedido por voz mientras solo un 22% de los clientes dice preferir el trato con IA, cuando las empresas creen que esa cifra ronda el 40%.
El CMO de Hilton explica que en un entorno publicitario en el que el recorrido del cliente ya no es lineal, la clave para las marcas radica en mantener su identidad narrativa mientras se adaptan a los nuevos hábitos de consumo digital. Por eso trabajan en el posicionamiento en LLMs, las recomendaciones en Reddit y el GEO. La cadena también ha cedido parte del control creativo a creadores de contenido e influencers, priorizando la resonancia orgánica sobre la perfección del mensaje. LINK
El coste de la IA que las agencias de medios llevan dos años sin repercutir está acabando en el inventario propio: el cliente no ve una factura de tokens, sino un porcentaje comprometido de su inversión en medios cuyo margen lo financia.
Google era un salvavidas para los editores. Ahora, algunos se plantean prescindir de él. WSJ
Aún hay más…
Los políticos empiezan a preocuparse de lo que dice la IA sobre ellos. Sus equipos aprenden a trabajar el GEO para (intentar) controlar la narrativa de los chatbots. NYT
Aquí podemos medir la huella medioambiental de nuestro uso de la IA.
Google DeepMind ha recreado el mejor gol de Pelé, del que no hay grabaciones, a partir de testimonios y descripciones. GOOGLE












