⏱️ Lectura: 9 min

Novartis no puede alimentar sus modelos de inteligencia artificial con décadas de patentes y artículos de química: ese archivo existe en prosa libre, no en un formato que un algoritmo pueda leer. Para resolverlo, CAS, la división de información científica de la American Chemical Society, anunció una colaboración con la farmacéutica suiza enfocada en la informática de reacciones, es decir, en convertir ese archivo en datos estructurados que sirvan para entrenar algoritmos de descubrimiento de fármacos.

📑 En este artículo
  1. TL;DR
  2. Qué es la informática de reacciones
  3. Qué pasó
  4. Contexto e historia
  5. Detalles técnicos
  6. Impacto y análisis
  7. Qué sigue
  8. Preguntas frecuentes
    1. ¿Qué gana Novartis con la curación de datos químicos que ofrece CAS?
    2. ¿En qué se diferencia esto de usar SciFinder o Reaxys?
    3. ¿Otras farmacéuticas preparan reacciones aptas para IA como Novartis?
    4. ¿CAS va a liberar estos datos de reacciones químicas al público?
    5. ¿Qué es el Registro CAS y por qué importa en esta alianza?
  9. Referencias

El acuerdo apunta a un cuello de botella conocido en química computacional: los datasets públicos de reacciones son pequeños y ruidosos, mientras que el conocimiento útil sigue encerrado en millones de documentos que ningún modelo puede procesar tal cual.

TL;DR

  • CAS y Novartis anunciaron una alianza para estructurar datos de reacciones químicas aptos para IA.
  • La división CAS de la American Chemical Society mantiene el Registro CAS y la base SciFinder.
  • Novartis busca entrenar modelos de predicción de síntesis con reacciones ya normalizadas y sin ruido.
  • Patentes y artículos rara vez traen las reacciones en un formato que un algoritmo pueda leer directamente.
  • El acuerdo se suma a la carrera farmacéutica por asegurar datos propios frente a modelos genéricos de IA.

Qué es la informática de reacciones

La informática de reacciones es la disciplina que convierte una reacción química descrita en texto (reactivos, condiciones, catalizadores, rendimiento) en un registro estructurado que un modelo de aprendizaje automático puede procesar sin intervención humana, a diferencia de una base bibliográfica que solo indexa el documento original.

El campo no es nuevo: laboratorios de IA farmacéutica llevan años intentando anticipar rutas de síntesis con modelos como IBM RXN for Chemistry o los que se entrenan con el dataset abierto de patentes de Estados Unidos (USPTO). El límite siempre fue el mismo: la reacción más completa suele estar dispersa entre un artículo, una patente y un cuaderno de laboratorio que ningún scraper convierte en algo entrenable sin años de trabajo manual de químicos expertos.

Una misma reacción publicada en dos patentes rara vez trae el rendimiento reportado en el mismo formato. Foto de Hitesh Choudhary en Unsplash

Qué pasó

La ACS, casa matriz de CAS, confirmó la alianza con Novartis para avanzar en la curación de datos de reacciones químicas aptas para IA, aunque no detalló montos ni cronograma de entrega. El objetivo declarado es que Novartis use el catálogo de reacciones de CAS, construido a partir del Registro CAS, como base de entrenamiento para sus propios modelos de descubrimiento de fármacos.

La colaboración no reemplaza el trabajo editorial que CAS ya hace con SciFinder, lo extiende. Además de indexar el documento donde aparece una reacción, cada reacción quedará etiquetada con sus variables (reactivos, disolvente, temperatura, rendimiento) en un esquema uniforme que un pipeline de entrenamiento pueda leer sin normalización adicional.

Contexto e historia

CAS nació como Chemical Abstracts Service en 1907, cuando la American Chemical Society empezó a resumir la literatura química mundial en un solo boletín. Hoy administra el Registro CAS, que desde 1957 asigna un identificador único a cada sustancia química conocida, y SciFinder, la base de búsqueda que usan la mayoría de los departamentos de química industrial y académica para rastrear reacciones, patentes y propiedades.

El interés de una farmacéutica como Novartis por estructurar sus datos de reacciones químicas no es casual. Diseñar un fármaco nuevo depende de encontrar una ruta de síntesis viable: qué reactivos combinar, en qué orden y bajo qué condiciones para llegar a la molécula objetivo sin generar subproductos tóxicos ni costos industriales prohibitivos. Ese problema, conocido como retrosíntesis, es uno de los que más se beneficia cuando se automatiza con modelos entrenados en reacciones bien etiquetadas, según reportan desde hace más de una década los laboratorios de IA farmacéutica que trabajan el tema.

Detalles técnicos

El mecanismo detrás de la informática de reacciones no es misterioso, pero sí costoso. Un documento de química describe una reacción en prosa: \”se disolvió el compuesto A en tetrahidrofurano a 0°C y se añadió gota a gota el reactivo B\”. Para que un modelo la use, alguien (un químico, o un sistema de extracción supervisado por uno) tiene que convertir esa oración en una fila de tabla: estructura del reactivo en notación SMILES, disolvente, temperatura exacta, tiempo de reacción, rendimiento reportado y producto final, también en SMILES.

Ese trabajo de normalización es el verdadero costo del proyecto. Bases como Reaxys y el propio SciFinder ya hacen una versión de esto para la literatura publicada, pero indexan el documento, no necesariamente la reacción en un esquema optimizado para entrenamiento: dos reacciones equivalentes descritas con distinta terminología pueden quedar como registros separados si nadie las reconcilió. Un dataset apto para IA, en cambio, necesita deduplicación, control de calidad sobre el rendimiento reportado (las patentes tienden a exagerarlo) y una taxonomía de tipos de reacción consistente en todo el corpus.

flowchart TD
A["Patentes y articulos quimicos"] --> B["Extraccion de reacciones"]
B --> C["Normalizacion de estructuras (SMILES)"]
C --> D["Dataset curado de reacciones"]
D --> E["Modelo de prediccion de sintesis"]

Ese pipeline explica por qué una compañía como CAS, con décadas de indexación editorial y químicos de planta dedicados a la curación, ocupa una posición distinta a la de un laboratorio de IA que solo raspa texto público: el cuello de botella no es el modelo, es la limpieza del dato de entrada.

Impacto y análisis

Para Novartis, el acuerdo encaja en una estrategia más amplia de la industria farmacéutica: asegurar acceso preferente a datos propios en lugar de depender de modelos genéricos entrenados con lo disponible en la web abierta. Los datos de reacciones químicas curados por un tercero especializado le ahorran a Novartis construir internamente el equipo de químicos anotadores que ese trabajo exige, un costo que compañías de su tamaño normalmente prefieren tercerizar en proveedores de datos consolidados.

La siguiente tabla compara las tres formas en que hoy se obtienen datos de reacciones para entrenar modelos de IA, y por qué la vía curada gana terreno pese a su costo:

MétodoFuente de datosVentajaLimitación
Minería de texto libreArtículos y patentes sin estructurarCobertura amplia, bajo costo inicialAlto ruido, faltan condiciones exactas
Bases comerciales (Reaxys, SciFinder)Literatura indexada editorialmenteDatos ya normalizados por documentoAcceso pago, cobertura limitada a lo indexado
Datos de reacciones químicas curados (CAS-Novartis)Colaboración CAS-NovartisEstructura pensada para entrenar modelosAlcance inicial acotado a lo pactado entre ambas partes

💭 Clave: el cuello de botella de la IA química nunca fue el modelo, fue conseguir suficientes reacciones limpias para entrenarlo.

El riesgo para el resto de la industria es de concentración: si CAS negocia acuerdos similares uno por uno con cada farmacéutica grande, el acceso a datos de calidad para entrenar IA de descubrimiento de fármacos puede terminar reservado a quien pueda pagarlo, ampliando la brecha frente a grupos académicos o biotechs pequeñas que dependen de datasets públicos, más chicos y ruidosos.

Qué sigue

Ni CAS ni Novartis precisaron si el acuerdo es exclusivo o si CAS ofrecerá el mismo servicio de informática de reacciones a otras farmacéuticas. La tendencia del sector sugiere que no será el único caso: Merck, Pfizer y otros laboratorios grandes anunciaron en los últimos años inversiones propias en IA para descubrimiento de fármacos, aunque casi siempre sin detallar de dónde sacan los datos de entrenamiento, que es precisamente el punto que este acuerdo pone en evidencia.

Lo que sí es previsible es que CAS use este acuerdo como vitrina: convertir literatura química en datos aptos para IA es un servicio replicable para cualquier industria que dependa de reacciones, como agroquímica, materiales o baterías, no solo para farmacéuticas.

📖 Resumen en Telegram: Ver resumen

Si querés ver qué tan estructurados están hoy esos datos, entrá a cas.org y buscá cualquier sustancia por su Registro CAS: ahí se nota la diferencia entre un documento indexado y una reacción realmente lista para entrenar un modelo.

📬 Recibí lo nuevo en tu email

Te avisamos de artículos grandes (1-2 por mes).

Preguntas frecuentes

¿Qué gana Novartis con la curación de datos químicos que ofrece CAS?

Acceso a datos de reacciones químicas normalizados y verificados por especialistas, listos para entrenar o ajustar modelos de predicción de síntesis sin construir ese proceso de curación puertas adentro.

¿En qué se diferencia esto de usar SciFinder o Reaxys?

SciFinder y Reaxys indexan documentos y reacciones para que un químico las busque manualmente. La curación de datos químicos de este acuerdo estructura cada reacción como un registro con variables fijas, pensado para que un modelo la procese sin intervención manual.

¿Otras farmacéuticas preparan reacciones aptas para IA como Novartis?

De forma general, sí: laboratorios como Merck y Pfizer invierten en inteligencia artificial para descubrimiento de fármacos, aunque rara vez detallan públicamente el origen y la curación de los datos de reacciones que usan para entrenar sus modelos.

¿CAS va a liberar estos datos de reacciones químicas al público?

No se anunció eso. El acuerdo es una colaboración comercial entre CAS y Novartis, y no hay indicios de que el catálogo curado vaya a publicarse fuera de ese convenio.

¿Qué es el Registro CAS y por qué importa en esta alianza?

El Registro CAS es el sistema que desde 1957 asigna un identificador único a cada sustancia química conocida. Es la base sobre la que CAS construye su catálogo de reacciones, incluido el que ahora prepara para Novartis.

Referencias

  • CAS: división de información científica de la American Chemical Society, encargada del Registro CAS y la base SciFinder.
  • Novartis: compañía farmacéutica suiza que invierte en inteligencia artificial aplicada al descubrimiento de fármacos.
  • American Chemical Society (ACS): organización matriz de CAS, referente en publicación y estandarización química.

📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.

Imagen destacada: Foto de Egor Myznik en Unsplash

¿Te sirvió? ¿Te dio otro error? Contalo abajo: las preguntas se responden y le sirven al siguiente que llegue.

Dejar un comentario

Andrés Morales

Desarrollador e investigador en inteligencia artificial. Escribe sobre modelos de lenguaje, frameworks, herramientas para devs y lanzamientos open source. Cubre papers de ML, ecosistema de startups tech y tendencias de programación.

0 Comentarios

Deja un comentario

Marcador de posición del avatar

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Podés incluir código entre <code>…</code> o, para varias líneas, <pre><code>…</code></pre>.

Este sitio usa Akismet para reducir el spam. Aprende cómo se procesan los datos de tus comentarios.