¿Miente la Inteligencia Artificial? Sí, y lo sabemos.

miente la inteligencia artificial

La inteligencia artificial generativa ha experimentado un crecimiento notable en los últimos años, con aplicaciones que van desde la creación de textos y imágenes hasta la generación de música y videos. Sin embargo, una de las principales preocupaciones que han surgido es la fiabilidad de los datos que estas plataformas ofrecen, ya que en ocasiones pueden generar información incorrecta o inventada sin una verificación adecuada.

¿Por qué miente la inteligencia artificial?

Los modelos de IA generativa, como los grandes modelos de lenguaje, se entrenan utilizando vastas cantidades de datos disponibles en internet. Estos datos incluyen información precisa, pero también contienen errores, sesgos y desinformación. Debido a la naturaleza de estos modelos, pueden aprender y replicar tanto la información correcta como la incorrecta presente en sus datos de entrenamiento. Además, estos modelos no tienen una comprensión real del mundo; en su lugar, generan respuestas basadas en patrones estadísticos aprendidos, lo que puede llevar a la creación de contenido que parece plausible pero que es incorrecto o inventado.

Ejemplos de información inventada por IA generativa

Un ejemplo destacado es el de los «deepfakes», que son videos, audios o imágenes manipulados mediante IA para parecer reales. Durante el año 2024, se realizaron elecciones en más de 60 países, y los deepfakes influyeron en la percepción pública de los candidatos, generando desinformación y afectando procesos democráticos.

Otro caso es el de los chatbots avanzados, como ChatGPT, que a veces proporcionan respuestas detalladas y convincentes que carecen de una base factual. Estos sistemas pueden generar información incorrecta con un tono de autoridad, lo que puede inducir a error a los usuarios que confían plenamente en sus respuestas.

Enfoques para una posible solución

  • Mejora en la calidad de los datos de entrenamiento: Es esencial que los modelos de IA se entrenen con datos precisos y verificados. Sin embargo, un estudio de la Data Provenance Initiative indica que el 25% de los datos de mayor calidad se ha vuelto inaccesible para los sistemas de IA, lo que agrava el problema.

La mejora en la calidad de los datos de entrenamiento es esencial para garantizar la fiabilidad y precisión de los modelos de inteligencia artificial (IA). Diversas estrategias y prácticas se están implementando para abordar este desafío:

1. Perfilado y limpieza de datos

Antes de utilizar los datos para entrenar modelos de IA, es fundamental analizar su estructura y contenido para identificar posibles errores o inconsistencias. Este proceso, conocido como perfilado de datos, permite detectar valores atípicos y evaluar la integridad de la información. Posteriormente, se procede a la limpieza de los datos, corrigiendo o eliminando imprecisiones, rellenando valores faltantes y resolviendo incoherencias. La combinación de herramientas automatizadas y procesos de revisión manual es común en esta etapa.

2. Integración y sincronización de datos

Con frecuencia, los datos provienen de múltiples fuentes. Integrar estos datos en un repositorio centralizado asegura que toda la información relevante esté disponible para el modelo de IA. Además, la sincronización en tiempo real garantiza la coherencia de los datos, permitiendo que cualquier actualización se refleje inmediatamente en todos los sistemas. Esto es especialmente útil en sectores como el financiero, donde la información de los clientes puede estar dispersa en diferentes departamentos.

3. Gobernanza de datos

Establecer un marco de gobernanza de datos implica definir políticas, procedimientos y responsabilidades para la gestión de la información. Esto asegura que los datos se manejen de manera coherente y que se mantengan estándares de calidad a lo largo del tiempo. Asignar roles claros para la gestión de datos fomenta una cultura de calidad dentro de la organización.

4. Controles de validación automatizados

Implementar herramientas automatizadas para monitorear continuamente la calidad de los datos permite detectar y corregir anomalías de manera proactiva. El uso de algoritmos de aprendizaje automático para identificar patrones inusuales o errores potenciales es una práctica emergente en este ámbito. Por ejemplo, una plataforma de comercio electrónico puede utilizar estos sistemas para analizar transacciones y detectar actividades fraudulentas.

5. Enfoque centrado en los datos

Tradicionalmente, el desarrollo de modelos de IA se ha centrado en mejorar los algoritmos. Sin embargo, existe una tendencia creciente hacia un enfoque centrado en los datos, donde se presta especial atención a la calidad y relevancia de los datos de entrenamiento. Esto implica seleccionar cuidadosamente los datos, asegurando que sean representativos y estén libres de sesgos, lo que puede mejorar significativamente el rendimiento del modelo.

6. Generación de datos sintéticos

En situaciones donde los datos reales son escasos o difíciles de obtener, la generación de datos sintéticos se presenta como una solución viable. Estos datos, creados artificialmente, pueden complementar los conjuntos de datos existentes, aumentando su volumen y diversidad sin comprometer la calidad. Esta práctica es especialmente útil en aplicaciones donde la recopilación de datos reales es costosa o presenta desafíos éticos.

7. Evaluación de la calidad de los datos

Desarrollar métodos para evaluar la calidad de los datos de entrenamiento es crucial. Por ejemplo, enfoques topológicos que analizan la estructura de los datos pueden ayudar a identificar subconjuntos de datos que son representativos del conjunto completo, permitiendo entrenar modelos de manera más eficiente con menos datos.

En resumen, mejorar la calidad de los datos de entrenamiento es un proceso multifacético que abarca desde la limpieza y validación de datos hasta la implementación de marcos de gobernanza y la generación de datos sintéticos. Estas prácticas buscan garantizar que los modelos de IA se basen en información precisa y relevante, mejorando así su fiabilidad y desempeño.

  • Desarrollo de IA «humilde»: El ingeniero español Pablo Martínez Olmos propone crear una IA capaz de indicar la incertidumbre de sus respuestas, admitiendo cuando no tiene suficiente información para proporcionar una respuesta precisa. Este enfoque busca recalibrar los algoritmos para restringir respuestas arbitrarias y mejorar su utilidad y seguridad.

El desarrollo de una inteligencia artificial (IA) «humilde» busca crear sistemas capaces de reconocer y comunicar sus propias limitaciones, especialmente en situaciones donde la información es insuficiente o incierta. Este enfoque pretende mejorar la fiabilidad y seguridad de las respuestas generadas por la IA, evitando el «exceso de confianza» que a menudo presentan los modelos actuales.

La propuesta de Pablo Martínez Olmos

El ingeniero español Pablo Martínez Olmos ha sido pionero en este ámbito. Su proyecto, titulado «Hacia una inteligencia artificial humilde y trazable (THAI)», tiene como objetivo desarrollar métodos para que la IA generativa reduzca su nivel de certeza cuando no dispone de información sólida en la que basar sus resultados. Martínez Olmos ha sido galardonado con una Beca Leonardo por esta iniciativa innovadora.

Una de las estrategias que propone es complicar el entrenamiento de las redes neuronales introduciendo ataques malintencionados y aumentando las restricciones de almacenamiento de información. Esto busca recalibrar los algoritmos para restringir respuestas arbitrarias y mejorar su utilidad, confiabilidad y seguridad. Este enfoque podría tener aplicaciones significativas en el ámbito médico, como la detección de biomarcadores y la mejora de tratamientos personalizados.

Otras iniciativas en el desarrollo de una IA «humilde»

Además del trabajo de Martínez Olmos, la comunidad científica y tecnológica está explorando diversas estrategias para fomentar la humildad en los sistemas de IA:

  1. IA Auditable: Este enfoque se centra en desarrollar sistemas de IA que mantengan un registro detallado de sus procesos de toma de decisiones, incluyendo datos, variables y transformaciones de modelos. La auditabilidad permite una mayor transparencia y facilita la identificación de áreas donde el modelo puede carecer de confianza en sus respuestas.
  2. Medición de la incertidumbre: Algunos investigadores están trabajando en técnicas para que los modelos de IA puedan cuantificar y comunicar su nivel de incertidumbre en las respuestas. Esto permitiría a los usuarios comprender mejor la fiabilidad de la información proporcionada y tomar decisiones más informadas.
  3. Entrenamiento con datos adversariales: Introducir ejemplos adversariales durante el entrenamiento de los modelos puede ayudar a la IA a reconocer situaciones en las que su confianza debe ser menor. Este método busca fortalecer la capacidad del modelo para manejar casos ambiguos o desconocidos de manera más cautelosa.
  4. Integración de mecanismos de rechazo: Implementar sistemas que permitan a la IA abstenerse de responder cuando la confianza en su salida es baja. Este mecanismo de rechazo es una forma directa de incorporar humildad, asegurando que la IA no proporcione información potencialmente incorrecta.

Estas iniciativas reflejan un movimiento creciente hacia el desarrollo de sistemas de IA más conscientes de sus limitaciones, promoviendo interacciones más seguras y confiables entre humanos y máquinas.

  • Implementación de sistemas de verificación: Iniciativas como la Coalición para la Procedencia y Autenticidad del Contenido (C2PA) proponen incluir metadatos para autenticar contenidos, ayudando a los usuarios a distinguir entre información real y generada por IA. Además, empresas y plataformas como Google SynthID, Truepic Vision y VerifAI apoyan la verificación de imágenes, videos y audios.

La proliferación de contenido generado por inteligencia artificial (IA) ha planteado desafíos significativos en cuanto a la autenticidad y veracidad de la información en línea. Para abordar estos retos, se han implementado diversas iniciativas y sistemas de verificación que buscan garantizar la procedencia y autenticidad del contenido digital.

Coalición para la Procedencia y Autenticidad del Contenido (C2PA)

La C2PA es una alianza formada por empresas líderes como Adobe, Arm, Intel, Microsoft y Truepic, con el objetivo de desarrollar estándares técnicos abiertos que certifiquen la fuente y el historial de los contenidos digitales. Su enfoque se centra en la creación de un estándar universal que permita a los creadores etiquetar contenido audiovisual con metadatos que indiquen su origen y cualquier modificación realizada. Esto se logra mediante la inclusión de una «huella digital» en cada archivo, facilitando la trazabilidad y autenticidad del contenido.

Iniciativas complementarias y herramientas de verificación

Además de la C2PA, otras organizaciones y empresas están desarrollando soluciones para autenticar y verificar contenido digital:

  • Iniciativa de Autenticidad de Contenidos (CAI): Liderada por Adobe, esta iniciativa busca establecer la procedencia del contenido digital mediante la captura de información desde el momento de su creación, incluyendo detalles sobre el autor, la ubicación y las herramientas utilizadas. Esta información se almacena como metadatos, proporcionando transparencia y confianza en la autenticidad del contenido.
  • Truepic: Especializada en la autenticación de imágenes y videos, Truepic utiliza técnicas avanzadas para verificar la procedencia y detectar cualquier manipulación en el contenido digital. Su tecnología es especialmente útil en campos donde la precisión y la fiabilidad son esenciales, como el diseño arquitectónico y el modelado de información de construcción (BIM).
  • Google SynthID: Desarrollado por Google, SynthID es una herramienta que permite identificar si una imagen ha sido capturada por una cámara, editada con software como Photoshop o creada por modelos de IA generativa. Esta tecnología se integra en los resultados de búsqueda de Google a través de la función «sobre esta imagen», proporcionando a los usuarios información sobre la procedencia de las imágenes que encuentran en línea.
  • VerifAI: Esta iniciativa propone verificar las salidas de la IA generativa desde una perspectiva de gestión de datos, analizando la calidad y consistencia de los datos subyacentes en lagos de datos multimodales, incluyendo archivos de texto, tablas y gráficos de conocimiento. Su objetivo es establecer una base más sólida para evaluar las salidas de los modelos de IA generativa, promoviendo la transparencia y la toma de decisiones con mayor confianza.

Desafíos y consideraciones en la implementación

A pesar de los avances, la implementación de estos sistemas enfrenta desafíos significativos:

  • Eliminación de metadatos: Los metadatos que certifican la procedencia pueden ser eliminados intencional o accidentalmente durante la distribución del contenido, especialmente en plataformas de redes sociales, lo que dificulta la verificación de la autenticidad.
  • Complejidad en la adopción: La adopción global de estos estándares requiere la colaboración de múltiples actores, incluyendo empresas tecnológicas, plataformas de contenido y organismos reguladores, lo que puede ser un desafío logístico y técnico.
  • Interoperabilidad: Es esencial que los estándares desarrollados sean interoperables y puedan ser implementados en diversas plataformas y dispositivos para garantizar su eficacia a nivel global.

En conclusión, la implementación de sistemas de verificación como la C2PA y otras iniciativas complementarias es crucial para garantizar la autenticidad y procedencia del contenido digital en la era de la IA generativa. Aunque existen desafíos en su adopción y ejecución, la colaboración interdisciplinaria e internacional es esencial para restaurar la confianza en la información que consumimos en línea.

  • Educación y concienciación del usuario: Es fundamental que los usuarios desarrollen un pensamiento crítico y aprendan a verificar la información antes de compartirla. Expertos sugieren analizar detenidamente el contenido, verificar la fuente y utilizar herramientas como la búsqueda inversa de imágenes y plataformas de verificación de hechos para identificar noticias falsas generadas por IA.

La educación y concienciación de los usuarios son fundamentales para combatir la desinformación y fomentar un uso responsable de la información en la era digital. Desarrollar el pensamiento crítico y aprender a verificar la información antes de compartirla son habilidades esenciales que se están promoviendo a través de diversas iniciativas y estrategias educativas.

Desarrollo del pensamiento crítico

El pensamiento crítico implica la capacidad de analizar, evaluar y sintetizar información de manera objetiva, permitiendo a los individuos tomar decisiones informadas y evitar la difusión de información errónea. Para cultivarlo, se proponen los siguientes pasos:

  1. Identificar el problema: Reconocer y definir claramente la cuestión o información que se presenta.
  2. Investigar: Recopilar información relevante de diversas fuentes confiables.
  3. Evaluar la relevancia de los datos: Determinar la pertinencia y credibilidad de la información obtenida.
  4. Cuestionar las suposiciones: Analizar críticamente las creencias o prejuicios que puedan influir en la interpretación de la información.
  5. Desarrollar conclusiones: Llegar a decisiones basadas en el análisis objetivo de los datos.
  6. Comunicar la solución: Compartir las conclusiones de manera clara y efectiva.
  7. Reflexionar sobre el proceso: Evaluar la eficacia del proceso de pensamiento crítico y considerar mejoras para el futuro.

Estas habilidades permiten a los individuos abordar problemas complejos y tomar decisiones fundamentadas.

Iniciativas educativas para fomentar el pensamiento crítico

Diversas organizaciones y programas están dedicados a promover el pensamiento crítico y la verificación de información:

  • Bachillerato Internacional (IB): Este programa educativo promueve el pensamiento crítico, la investigación y el aprendizaje significativo, adaptándose a los intereses individuales de los estudiantes. Se enfoca en enseñar a resolver problemas complejos y a conectar conceptos con situaciones reales, haciendo el aprendizaje más relevante y útil.
  • Fundación Comunicando Futuro: Ha liderado un manifiesto contra la desinformación, al que se han sumado más de 100 instituciones y profesionales. El objetivo es fomentar prácticas que alienten el pensamiento crítico y la difusión responsable de información, contrarrestando las noticias falsas.
  • UNESCO: Ofrece cursos masivos en línea sobre Alfabetización Mediática e Informacional, dirigidos a educadores y profesionales para fortalecer sus habilidades en el entorno digital. Estos cursos proporcionan formación integral sobre el uso responsable y crítico de la información, la tecnología y los medios.
  • Maldita.es: Esta organización ofrece una plataforma para verificar noticias y bulos, además de realizar talleres y cursos para enseñar a identificar noticias falsas. Anima a los ciudadanos a cuestionar la información que reciben y a desarrollar un pensamiento crítico.

Estrategias didácticas en el aula

En el ámbito educativo, se han propuesto diversas estrategias para fomentar el pensamiento crítico entre los estudiantes:

  • Análisis de situaciones reales: Utilizar eventos del contexto del estudiante como objeto de reflexión para formar un pensamiento más crítico y autónomo.
  • Debates en línea: Fomentar debates sobre temas actuales para desarrollar habilidades de argumentación y análisis crítico.
  • Evaluación de fuentes: Enseñar a los estudiantes a evaluar la credibilidad de las fuentes de información que consultan.
  • Resolución de problemas: Plantear problemas complejos que requieran un análisis profundo y la aplicación de diversas perspectivas para su solución.

Estas estrategias buscan crear un entorno educativo que promueva la reflexión crítica y la capacidad de los estudiantes para discernir información veraz.

Fomentar el pensamiento crítico y la verificación de información antes de compartirla es esencial para combatir la desinformación en la sociedad actual. A través de programas educativos, iniciativas de concienciación y estrategias didácticas, se busca equipar a los individuos con las habilidades necesarias para navegar de manera responsable en el entorno informativo contemporáneo.

Conclusión

Aunque la inteligencia artificial generativa ofrece numerosas ventajas y oportunidades, es crucial abordar los desafíos relacionados con la fiabilidad de los datos que produce. Mediante la mejora de los datos de entrenamiento, el desarrollo de modelos más transparentes, la implementación de sistemas de verificación y la educación de los usuarios, es posible mitigar los riesgos asociados y fomentar un uso más seguro y efectivo de estas tecnologías.

Autor: Jordi Sabater

Scroll al inicio