|

Por qué unos experimentos de IA en empresas triunfan y otros se apagan en silencio

No hubo protestas. No hubo un correo molesto, ni una reunión tensa, ni un solo «no» pronunciado en voz alta. Los profesionales del bufete, sencillamente, dejaron de aparecer. Así —en silencio— murió uno de los dos experimentos de IA en empresas más reveladores que he leído en mucho tiempo. El otro, nacido casi el mismo día, con la misma tecnología y las mismas garantías, terminó con 141 soluciones corporativas de IA generativa en uso y cientos de personas expertas sumándose voluntariamente. Misma primavera de 2023, mismo punto de partida, dos finales opuestos. ¿Qué marcó la diferencia?

La historia la cuentan Arvind Karunakaran (Stanford), Katherine C. Kellogg (MIT Sloan) y Batia Wiesenfeld (NYU Stern) en un artículo publicado el 6 de agosto en Harvard Business Review, fruto de un estudio de campo cualitativo de dos años —con entrevistas semiestructuradas y observación etnográfica de los expertos en su trabajo diario— cuyo paper académico está disponible en SSRN. Un apunte de transparencia antes de seguir: los autores anonimizan a las dos organizaciones bajo los pseudónimos NE Health —un centro médico académico estadounidense— y LegalCo —un bufete de abogados—. Todos los datos que leerás a continuación proceden del estudio, no de fuentes propias.

Dos experimentos de IA en empresas casi idénticos

Lo curioso de este caso es que elimina las excusas habituales. Según los autores, ambas organizaciones lanzaron la IA generativa en primavera de 2023 con sandboxes seguros, que para aclarar son entornos aislados con modelos conformes legalmente, sistemas conectados a sus propios datos y formación inicial para los equipos. Y en el entorno que la investigación previa considera determinantes —el encaje entre tecnología y problema, la preparación operativa, el cumplimiento normativo— no había diferencias significativas entre las dos.

En NE Health, los expertos —médicos y profesionales asistenciales, gente sin cargo tecnológico alguno— desarrollaron una solución corporativa de resúmenes de alta hospitalaria comprensibles para el paciente. En LegalCo, los abogados trabajaban en una solución de investigación jurídica. Dos proyectos serios, útiles, inicialmente igual de bien planteados. ¿Qué sucedió después?

141 soluciones frente a 3: el desenlace que nadie esperaba

Tres años después, el contraste es rotundo. En NE Health los expertos siguieron experimentando de forma colectiva, añadiendo incluso más profesionales al proyecto, desarrollando más de un centenar de soluciones nuevas: hoy son 141 soluciones corporativas de IA generativa en uso, muchas más en desarrollo y cientos de personas expertas —con puestos ajenos a la tecnología— sumadas por voluntad propia. La organización lo vive, según el estudio, como un cambio cultural que empodera.

En LegalCo ocurrió lo contrario, y ocurrió sin ruido. Los expertos empezaron a abandonar el experimento en silencio: sin negarse, sin resistirse, sin presionar. Simplemente dejaron de participar. Más del 80 % de los expertos de dominio acabó abandonando, solo 3 soluciones corporativas llegaron a estar en uso, el resto de proyectos se apagó y la organización redujo drásticamente su innovación en investigación jurídica. Nadie mató el programa, simplemente se quedó sin gente.

El trabajo invisible que decide el resultado

¿Qué explica la diferencia? Los autores la resumen en una palabra: scaffolding, traducido sería algo así como el andamiaje, aunque creo que es mejor llamarlo soporte, en este caso que mitiga el trabajo oculto de la experimentación colectiva. Porque experimentar con IA generativa no es «probar una herramienta»: los expertos prueban, comparan, documentan y eligen casos de uso, prompts, métricas y formatos… además de su carga de trabajo, ya de por sí exigente. El estudio identifica tres modos de esa experimentación colectiva: el ensayo-error colectivo, la revisión y el refinado colectivos, y el alineamiento y la integración colectivos. Tres formas de trabajo real que casi nunca aparecen en ningún organigrama.

Ese es el matiz que me parece decisivo. Hablamos mucho de modelos, de licencias, de casos de uso. Hablamos poco del tiempo, el criterio y la energía de las personas que sostienen todo eso.

Los cuatro soportes que marcaron la diferencia

El estudio destila un manual de estrategia de cuatro soportes, y el contraste entre ambas organizaciones los ilustra uno a uno. Primero, el soporte del ensayo-error: NE Health ofreció formación y reciclaje continuos —por ejemplo, promptathons que son una especie de competencia o taller colaborativo donde personas de varias áreas se unen para resolver problemas reales. A diferencia de un maratón de código tradicional o hackathon, no se escribe código de programación; en su lugar, los equipos diseñan, prueban y mejoran prompts (las instrucciones escritas para guiar a una inteligencia artificial) —. Esto deriva en un método ligero y claro de documentación —diarios de prompts— y un triaje que asignaba un experto técnico dedicado a los proyectos prioritarios; LegalCo se quedó en la formación inicial, una documentación difusa y ayuda técnica intermitente.

Segundo, el soporte en la revisión y el refinado: ambas crearon foros híbridos, pero solo NE Health construyó una rúbrica compartida de evaluación con pesos explícitos —precisión, cumplimentación total, legibilidad y orientación al paciente— y foros de intercambio de buenas prácticas. Tercero, el soporte del alineamiento y la integración: NE Health dio a sus expertos un filtro de riesgos claro —técnico, operativo, de cumplimiento y de retorno— y su equipo de TI ayudó a robustecer prototipos e integrarlos en la historia clínica electrónica; en LegalCo no había ni filtro ni apoyo de integración, y los expertos —según el estudio— «perdieron enormes cantidades de tiempo» con soluciones sin criterios claros y apaños manuales contra la base de datos jurídica histórica.

Y cuarto, quizá el más incómodo: el soporte de roles y recompensas. Reconocer formalmente ese trabajo en las descripciones de puesto, acreditarlo en la evaluación del desempeño y que lleguen recompensas materiales: subidas, bonus, promociones. En NE Health la participación se tradujo en publicaciones, promociones y crecimiento profesional. En LegalCo, un experto anónimo citado en el estudio lo resume con una frase que debería colgar en muchos despachos: «Mi evaluación anual sigue basada en los mismos criterios que antes de que existiera la IA generativa. Todo ese trabajo es invisible cuando llega la evaluación».

Infografía de los experimentos de IA en empresas del estudio de HBR: NE Health (141 soluciones) frente a LegalCo (3 soluciones) y los 4 andamiajes
Infografía: La misma IA, dos finales opuestos — el estudio de HBR sobre experimentos de IA en empresas. © 2026 yolandahernandez.es

La lección para nuestras pymes: no hace falta ser un gigante

Sé lo que puede estar pensando quien dirige una pyme en Canarias o en cualquier otro punto de España o del exterior: «yo no tengo un centro médico académico ni un equipo de TI que integre prototipos». Cierto. Pero fíjate en la naturaleza de los cuatro soportes: formación continua, una manera sencilla de documentar lo aprendido, criterios claros para decidir qué merece la pena y reconocimiento a quien pone el hombro. Nada de eso exige tamaño; exige criterio, propósito y responsabilidad. Un diario de prompts compartido cabe en cualquier empresa de cinco personas. Una rúbrica de evaluación puede ser una página. Y revisar la evaluación del desempeño para que la experimentación con IA cuente —y se pague— es una decisión de dirección, no de presupuesto.

Los autores señalan una creencia muy extendida entre quienes lideran: que la experimentación colectiva es una tarea desafiante, un reto extra que las personas motivadas absorberán en su tiempo libre. El estudio demuestra que lo hacen… solo durante un tiempo. Después se retiran en silencio, como en LegalCo. Y cuando el talento se retira en silencio, no hay tecnología que lo compense. La decisión de participar, concluyen los autores, «no la determina la tecnología en sí, sino el soporte que la rodea».

Llevo años defendiendo que en esta transformación (primero digital y ahora con la Inteligencia Artificial) las personas no son un recurso más: son el terreno donde todo lo demás arraiga o se seca. Este estudio le pone cifras a esa convicción —141 frente a 3— y le pone también nombre al riesgo: el trabajo invisible que damos por hecho.

¿Cuánto trabajo invisible está sosteniendo hoy la IA en tu organización… y qué estás haciendo para que deje de serlo?

Publicaciones Similares