Ep 44 — Aprendizaje automático en espectroscopia infrarroja

Serie: Enciclopedia de espectroscopia infrarroja: de los fundamentos a la práctica
Capítulo: Cuarto · Avanzado — Tecnologías de vanguardia (parte final, episodio 4)
Público objetivo: Estudiantes de posgrado en química analítica/química con IA, investigadores en quimioinformática/química computacional, constructores de laboratorios inteligentes, ingenieros de descubrimiento de fármacos y ciencia de materiales
Conocimientos previos: Ep 18 (procesamiento de espectros), Ep 19 (búsqueda en bibliotecas), Ep 25 (adulteración de alimentos), Ep 33 (diagnóstico biomédico), Ep 43 (quimiometría), conceptos básicos de aprendizaje automático
Tiempo de lectura: aproximadamente 60 minutos


Introducción: Cuando la IA aprende a "leer" espectros IR

En agosto de 2025, Analytical Chemistry publicó un trabajo notable [1]: el equipo de la Universidad de Nanjing propuso SSIN (Substructure-Structured Interpretation Network) — un modelo de aprendizaje profundo interpretable que puede detectar directamente los grupos funcionales presentes a partir de un espectro IR, proporcionando evidencia visual de "por qué hizo esa inferencia". Es uno de los hitos en IA explicable (XAI) para la química.

"Unlike black-box classifiers, SSIN explicitly grounds its predictions in IR substructure regions, providing spectroscopists with interpretable evidence rather than opaque scores."
—— NGS00 et al. Anal Chem 2025 [1]

En julio del mismo año, apareció un preprint en arXiv [2] que proponía un marco de razonamiento multitarea para espectroscopia IR impulsado por LLM — permitiendo que modelos de lenguaje grandes (como GPT-4, Claude) realizaran tareas como asignación de espectros, predicción de compuestos, búsqueda en literatura, etc., mediante ingeniería de prompts. Esto sugiere: la forma de trabajar de los espectroscopistas infrarrojos podría estar a punto de cambiar fundamentalmente.

Para 2026, CCS Chemistry reportó un trabajo aún más de ciencia ficción [3]: IR-Bot — un "laboratorio químico no tripulado" compuesto por un robot autónomo + espectrómetro IR + inferencia ML. Puede tomar muestras automáticamente, adquirir espectros, invocar modelos ML para dar inferencias y decidir el próximo experimento. Esto significa que la espectroscopia infrarroja ha entrado oficialmente en la era del "laboratorio autónomo (Autonomous Lab)".

En este episodio, explicaremos sistemáticamente la aplicación del aprendizaje automático en espectroscopia infrarroja:

  • Compensaciones entre quimiometría tradicional vs. aprendizaje automático;
  • Métodos supervisados como SVM, Random Forest, XGBoost;
  • CNN para reconocimiento de espectros;
  • Explicación detallada de tres trabajos de vanguardia 2025–2026 (SSIN, LLM-IR, IR-Bot);
  • Puntos de referencia de código abierto para ML espectral (RamanBench, etc.);
  • Consejos prácticos y perspectivas futuras.

1. Quimiometría tradicional vs. Aprendizaje automático

1.1 Tabla para entender "cuál usar"

En el análisis de espectros IR, la "quimiometría tradicional" (PCA/PLS/SIMCA) y el "aprendizaje automático" (SVM/RF/XGBoost/deep learning) a menudo se mezclan, pero sus escenarios de aplicación difieren significativamente [4][5]:

Dimensión Quimiometría tradicional (PCA/PLS) ML clásico (SVM/RF) Deep learning (CNN/Transformer)
Número de muestras requerido n ≥ 50 n ≥ 100 n ≥ 1000
Dimensión de datos p > n (alta dimensión dispersa) Media Grandes datos
Ingeniería de características No necesaria (encuentra LV automáticamente) Necesita selección de números de onda Completamente automática
Interpretabilidad Alta (gráficos de carga claros) Media (importancia de características) Baja (caja negra)
Capacidad no lineal Baja (PLS es lineal) Media (función kernel) Alta
Tiempo de entrenamiento Segundos Minutos Horas–días
Requisitos de hardware CPU CPU GPU
Escenario de aplicación Cuantificación con muestras pequeñas, estudio mecanístico Clasificación con muestras medianas Clasificación con muestras grandes, patrones complejos
Requisitos de datos Pocos datos etiquetados Medios Muchos datos etiquetados

Tabla 1: Comparación de aplicabilidad de tres métodos en espectroscopia IR

1.2 Diagrama de flujo de decisión

   ¿Número de muestras n?
   ├── n < 50 → Usar quimiometría tradicional (PCA/PLS/SIMCA)
   ├── 50 ≤ n < 200 → Priorizar PLS; si se necesita no linealidad, añadir SVM
   ├── 200 ≤ n < 1000 → SVM, Random Forest, XGBoost
   └── n ≥ 1000 → CNN / Transformer / LLM

   ¿Tu objetivo?
   ├── Cuantificación (regresión) → PLS / SVM-R / XGBoost-R
   ├── Clasificación (identificación) → SVM / RF / PLS-DA
   ├── Detección de anomalías → PCA / One-Class SVM
   ├── Asignación de espectros → SSIN / LLM-IR (ver más adelante)
   └── No tripulado → Estilo IR-Bot (ver más adelante)

   ¿Requisitos de interpretabilidad?
   ├── Alto (investigación, regulación) → PLS, SSIN, explicación SHAP
   ├── Medio (aplicaciones QC) → RF/XGBoost + importancia de características
   └── Bajo (predicción de caja negra) → CNN / Transformer

Figura 1: Diagrama de flujo de selección de métodos ML


2. Aprendizaje supervisado: SVM, Random Forest, XGBoost

2.1 SVM (Máquinas de vectores de soporte)

Máquinas de vectores de soporte fueron el método "principal" para clasificación de espectros IR en la década 2010–2020 [4][6]:

  • Principio: mediante función kernel, mapea los datos a un espacio de alta dimensión y encuentra el hiperplano de margen máximo;
  • Kernels comunes: RBF (base radial), polinomial, lineal;
  • Parámetros: parámetro de penalización C, parámetro del kernel γ;
  • Ventajas: buen rendimiento con muestras pequeñas, resistencia al sobreajuste;
  • Desventajas: ajuste de parámetros complejo, no apto para grandes conjuntos de datos.

Aplicaciones en IR: Identificación de polimorfos de fármacos [6], clasificación de plásticos, adulteración de alimentos, identificación de bacterias.

from sklearn.svm import SVC
from sklearn.model_selection import GridSearchCV

# Búsqueda en cuadrícula para encontrar mejor C, γ
param_grid = {
    'C': [0.1, 1, 10, 100],
    'gamma': ['scale', 0.001, 0.01, 0.1, 1],
    'kernel': ['rbf']
}
svm = GridSearchCV(SVC(), param_grid, cv=5, scoring='accuracy')
svm.fit(X_train, y_train)
print(svm.best_params_)  # {'C': 10, 'gamma': 0.01, 'kernel': 'rbf'}

2.2 Random Forest (Bosque aleatorio)

Random Forest mejora el rendimiento de clasificación/regresión mediante el ensamblaje de múltiples árboles de decisión [7]:

  • Principio: muestreo Bootstrap + selección aleatoria de características + votación de múltiples árboles;
  • Ventajas: resistente al sobreajuste, puede generar importancia de características (qué números de onda son más críticos para la clasificación);
  • Desventajas: entrenamiento lento, modelado débil de relaciones lineales;
  • Parámetros: número de árboles (n_estimators), profundidad (max_depth);
  • Aplicaciones: identificación de adulteración de aceite de oliva, clasificación de suelos, clasificación de tejidos biológicos.
from sklearn.ensemble import RandomForestClassifier
import matplotlib.pyplot as plt

rf = RandomForestClassifier(n_estimators=500, max_depth=10, random_state=42)
rf.fit(X_train, y_train)
# Salida de importancia de características (por número de onda)
importances = rf.feature_importances_
plt.plot(wavenumber, importances)

plt.xlabel("Número de onda (cm⁻¹)")
plt.ylabel("Importancia de Característica")


**El mapa de importancia de características** es el "as bajo la manga" de Random Forest: te indica qué números de onda contribuyen más a la clasificación, proporcionando **directamente una explicación química** [7].

### 2.3 XGBoost

**XGBoost (Extreme Gradient Boosting)** es el "dominante" de las competiciones de Kaggle en los últimos años y también ha entrado en el campo de la espectroscopia infrarroja [8]:

- Principio: implementación eficiente del árbol de decisión de boosting de gradiente (GBDT);
- Ventajas: alto rendimiento, resistencia al sobreajuste, puede generar importancia de características;
- Desventajas: numerosos parámetros (> 10), propenso al sobreajuste;
- Aplicaciones: cuantificación de mezclas complejas, clasificación multiclase.

```python
import xgboost as xgb

dtrain = xgb.DMatrix(X_train, label=y_train)
dtest = xgb.DMatrix(X_test, label=y_test)

params = {
    'max_depth': 6,
    'eta': 0.1,
    'objective': 'multi:softmax',
    'num_class': 5
}
model = xgb.train(params, dtrain, num_boost_round=200)
y_pred = model.predict(dtest)

2.4 Comparación de los tres métodos

Método Ventajas Desventajas Escenario de aplicación
SVM Bueno con muestras pequeñas, resistente al sobreajuste Parámetros difíciles de ajustar, lento con datos grandes n < 500, estudios de mecanismo
Random Forest Resistente al sobreajuste, interpretable Entrenamiento lento Datos medianos, interpretación de características
XGBoost Mayor rendimiento Muchos parámetros, propenso al sobreajuste Grandes datos, tareas estilo Kaggle

Tabla 2: Comparación de tres métodos de aprendizaje supervisado

🔗 Lectura adicional: Las características de entrada de los métodos anteriores suelen ser el espectro infrarrojo completo o el espectro preprocesado. Para el significado químico de los números de onda característicos (como C=O ~1700, N-H ~3300, O-H ~3400), consulte ftir.fun página del grupo carbonilo, ftir.fun página del grupo amina y ftir.fun página del grupo hidroxilo.


III. Aprendizaje profundo: CNN para reconocimiento de espectros

3.1 ¿Por qué se necesita el aprendizaje profundo?

El aprendizaje automático tradicional requiere ingeniería de características manual (elegir qué números de onda, qué preprocesamiento). El aprendizaje profundo elimina este paso mediante aprendizaje automático de características [5][9]:

  • Entrada: espectro original (secuencia unidimensional);
  • El modelo aprende automáticamente "qué combinaciones de números de onda" son importantes para la tarea;
  • Salida: resultado de clasificación o regresión.

3.2 Arquitectura de 1D-CNN

El espectro infrarrojo es esencialmente una secuencia unidimensional (el número de onda como analogía del eje temporal), adecuado para 1D-CNN (red neuronal convolucional unidimensional) [9]:

   Espectro de entrada (1000 dimensiones)
        ↓
   Conv1D(32 filtros, kernel=5) → detecta "combinaciones de picos" locales
        ↓
   MaxPool1D(2) → reducción de dimensionalidad
        ↓
   Conv1D(64 filtros, kernel=5) → detecta "combinaciones de picos" de nivel superior
        ↓
   MaxPool1D(2) → reducción de dimensionalidad
        ↓
   Flatten → Dense(128) → Dropout(0.5)
        ↓
   Salida (softmax, clasificación multiclase)

Figura 2: Arquitectura típica de 1D-CNN

import tensorflow as tf
from tensorflow.keras import layers, models

model = models.Sequential([
    layers.Input(shape=(1000, 1)),
    layers.Conv1D(32, 5, activation='relu'),
    layers.MaxPooling1D(2),
    layers.Conv1D(64, 5, activation='relu'),
    layers.MaxPooling1D(2),
    layers.Flatten(),
    layers.Dense(128, activation='relu'),
    layers.Dropout(0.5),
    layers.Dense(num_classes, activation='softmax')
])
model.compile(optimizer='adam', loss='sparse_categorical_crossentropy', metrics=['accuracy'])
model.fit(X_train, y_train, epochs=50, batch_size=32, validation_split=0.2)

3.3 Ventajas y trampas de CNN

Ventajas:

  • Aprendizaje automático de características, sin necesidad de selección manual de números de onda;
  • Puede manejar desplazamientos espectrales (el mismo compuesto tiene deriva de frecuencia debido a diferencias instrumentales);
  • Adecuado para datos a gran escala.

Trampas:

  • Sobreajuste severo: cuando los datos infrarrojos tienen alta dimensionalidad y pocas muestras, es muy fácil sobreajustar;
  • Caja negra: el modelo da predicciones, pero no puede explicar por qué — esto es lo que SSIN (ver Sección IV) intenta resolver;
  • Aumento de datos: normalmente se necesitan SMOTE, desplazamiento espectral, adición de ruido, etc.;
  • Adaptación de dominio: el modelo entrenado en el instrumento A puede fallar en el instrumento B, requiriendo adaptación de dominio.

3.4 Trabajo clásico: CNN para clasificación de plásticos

Acquarelli et al. en 2017 en TrAC compararon sistemáticamente CNN con PLS-DA y SVM en clasificación de espectros infrarrojos [10]:

  • Datos: 3000 muestras de plástico con espectros ATR-FTIR;
  • Clases: PE/PP/PS/PVC/PET/PA/PC/PMMA/ABS, 9 clases en total;
  • Resultados:
    • PLS-DA precisión 92%;
    • SVM 95%;
    • 1D-CNN 98%;
  • Pero CNN necesitó 10 veces más datos de entrenamiento que SVM para alcanzar ese rendimiento.

IV. IA explicable: Detalle de SSIN

4.1 Innovación central de SSIN

SSIN (Substructure-Structured Interpretation Network) fue publicado por el equipo de la Universidad de Nanjing en Analytical Chemistry 2025, 97(38) [1], código abierto en GitHub [11]:

Idea central: en lugar de usar una única caja negra para predecir, la red aprende explícitamente las regiones infrarrojas correspondientes a los grupos funcionales y utiliza estas regiones como evidencia para la predicción.

4.2 Arquitectura de SSIN

   Espectro infrarrojo de entrada (4000–400 cm⁻¹)
        ↓
   Codificador (1D-CNN / Transformer)
        ↓
   Predictor de subestructuras (multitarea)
   ├── Probabilidad de -OH (región 3300–3500)
   ├── Probabilidad de -NH (región 3300–3500)
   ├── Probabilidad de C=O (región 1650–1800)
   ├── Probabilidad de C=C anillo aromático (región 1450–1650)
   ├── Probabilidad de C-O-C (región 1000–1300)
   └── ...
        ↓
   Mapa de atención → visualización "qué números de onda vio el modelo"
        ↓
   Predicción final (clase de compuesto)

Figura 3: Diagrama de la arquitectura SSIN. Cada "cabeza de predicción de subestructura" corresponde a un grupo funcional y se enfoca explícitamente en la región de número de onda correspondiente.

4.3 Significado de "interpretable" de SSIN

Una CNN normal da: "Esto es ácido benzoico, con un 95% de confianza" — pero no te dice por qué.

SSIN da:

  1. "Se detectó O–H (pico ancho a 2700–3300 cm⁻¹, confianza 0.92)";
  2. "Se detectó C=O (1680–1720 cm⁻¹, confianza 0.88, compatible con ácido carboxílico)";
  3. "Se detectó anillo aromático (cuarteto a 1450, 1500, 1580, 1600 cm⁻¹, confianza 0.95)";
  4. "Inferencia combinada: ácido benzoico (C₆H₅COOH), confianza 0.91".

Esta "explicación subestructural" permite a los espectroscopistas revisar directamente el proceso de razonamiento del modelo, coherente con la lógica de interpretación artificial de espectros [1].

4.4 Valor de aplicación de SSIN

  • Enseñanza: Puede servir como "asistente de IA" para que los estudiantes aprendan análisis espectral;
  • Investigación: Ayuda en la asignación de espectros complejos y proporciona sugerencias;
  • QC: Identificación automática con evidencia, cumpliendo con los requisitos de "trazabilidad" de GMP;
  • Etiquetado de datos: Etiquetado automático de espectros no anotados, acelerando la construcción de bases de datos.

🔗 Lectura adicional: Los rangos de número de onda precisos de los grupos funcionales detectados por SSIN (C=O, O-H, N-H, anillo aromático, C-O-C, etc.) se detallan en ftir.fun página de grupos funcionales, especialmente ftir.fun página de carbonilo, ftir.fun página de hidroxilo y ftir.fun página de amida.


5. Razonamiento multitarea de espectroscopia IR impulsado por LLM

5.1 Principio de funcionamiento

El preprint de arXiv de julio de 2025 [2] propuso el marco de razonamiento multitarea de espectroscopia IR impulsado por LLM — convertir los datos del espectro IR en descripciones de texto, permitiendo que los grandes modelos de lenguaje (GPT-4, Claude) realicen razonamientos multitarea:

   Espectro IR (arreglo numérico)
        ↓
   [Espectro a texto] Extraer picos principales: 3400 cm⁻¹ (O-H), 1720 cm⁻¹ (C=O), ...
        ↓
   [Ingeniería de prompts] "Basado en los siguientes datos IR:
                  lista de picos principales + contexto de literatura + descripción de la tarea,
                  inferir el tipo de compuesto y dar el proceso de razonamiento."
        ↓
   Razonamiento LLM
        ↓
   Salida: predicción del compuesto + cadena de razonamiento + confianza

5.2 Capacidad multitarea

El marco LLM-IR puede manejar múltiples tareas [2]:

  • Asignación espectral: Dada una lista de picos IR, asignar posibles grupos funcionales;
  • Predicción de compuestos: Inferir el tipo de compuesto combinando múltiples picos;
  • Búsqueda en literatura: Encontrar literatura similar basada en características espectrales;
  • Monitoreo de reacciones: Inferir el progreso de la reacción basado en espectros de series temporales;
  • Asistencia educativa: Explicar la relación entre las características espectrales y la estructura química.

5.3 Ventajas y limitaciones

Ventajas:

  • Aprovecha el conocimiento químico existente de los LLM, fuerte capacidad de aprendizaje zero-shot;
  • Puede manejar preguntas en lenguaje natural sin entrenamiento especializado;
  • Proceso de razonamiento transparente (explicación generativa).

Limitaciones:

  • El espectro debe convertirse primero a texto, perdiendo algo de información;
  • Baja sensibilidad a diferencias sutiles de frecuencia (p. ej., difícil distinguir 1710 vs 1720 cm⁻¹);
  • Depende del conocimiento químico del LLM, propenso a "alucinaciones";
  • Alto costo de inferencia (cada espectro requiere una llamada API).

5.4 Complementariedad de LLM-IR y SSIN

LLM-IR y SSIN forman un "complemento combinado":

  • SSIN: Detección precisa de grupos funcionales + evidencia interpretable, adecuado para detección automática;
  • LLM-IR: Inferencia global + explicación en lenguaje natural, adecuado para análisis conversacional;
  • Dirección futura: Usar la salida de SSIN como entrada del LLM, formando una "IA de dos etapas" — primero detección fina, luego razonamiento integrado.

6. IR-Bot: Robot autónomo + IR + ML

6.1 Visión de IR-Bot

IR-Bot publicado en CCS Chemistry en 2026 [3]:

"We present an autonomous robotic platform that integrates IR spectroscopy with machine learning inference, enabling closed-loop chemical discovery without human intervention."
—— CCS Chemistry 2026 [3]

IR-Bot es un sistema completamente en circuito cerrado:

  1. El brazo robótico toma muestras automáticamente;
  2. Medición automática por ATR-FTIR;
  3. Inferencia automática por modelos ML (SSIN + LLM);
  4. El algoritmo de decisión determina el siguiente experimento;
  5. Repetir el proceso hasta alcanzar el objetivo.

6.2 Escenarios de aplicación de IR-Bot

  • Cribado de alto rendimiento de fármacos: Probar espectros IR de 1000+ compuestos en un día;
  • Optimización de reacciones: Explorar condiciones de reacción automáticamente, monitorear la formación de productos por IR;
  • Identificación de desconocidos: Separación e identificación automática de mezclas;
  • Asistencia educativa: Los estudiantes operan de forma remota, el robot ejecuta automáticamente.

6.3 IR-Bot y la ola de "laboratorios autónomos"

IR-Bot es parte de la ola de "laboratorios autónomos" en química [3][12]:

  • 2018: "Robot Chemist" de Liverpool optimiza automáticamente materiales fotocatalíticos [12];
  • 2020: Coley et al. usan IA para diseñar rutas de síntesis;
  • 2023: Plataforma AI de síntesis química IBM RXN se populariza;
  • 2026: IR-Bot "automatiza" también a los espectroscopistas IR.

Tendencias futuras:

  • Fusión multimodal: Automatización simultánea de IR + NMR + MS + UV-Vis;
  • Aprendizaje federado: Robots de múltiples laboratorios aprenden colaborativamente sin compartir datos brutos;
  • Laboratorio en la nube: Investigadores diseñan experimentos de forma remota, robots en la nube ejecutan.

7. Referencia de ML de código abierto: RamanBench y evaluación de ML espectral

7.1 Necesidad de referencias de ML

En el campo del aprendizaje automático existen referencias reconocidas como ImageNet, GLUE, pero el ML espectral ha carecido durante mucho tiempo de una referencia unificada — esto lleva a:

  • Difícil comparar el rendimiento entre artículos;
  • Las técnicas de ajuste de parámetros eclipsan la esencia del método;
  • Reproducibilidad deficiente.

7.2 RamanBench

RamanBench [13] es un marco de evaluación de ML para espectroscopia Raman publicado en 2024, pero su diseño es altamente compatible con el ML de IR:

Características:

  • Proporciona conjuntos de datos estandarizados (miles de espectros Raman etiquetados);
  • Definiciones de tareas estandarizadas (clasificación, regresión, detección de anomalías);
  • Métricas de evaluación estandarizadas (precisión, F1, RMSEP);
  • Modelos de referencia (PLS, SVM, CNN, Transformer);
  • Tabla de clasificación pública para facilitar la comparación de métodos.

7.3 ¿Cuándo llegará el "ImageNet" del ML de IR?

Actualmente, el campo del ML de IR aún espera el "momento ImageNet":

  • Cuello de botella de datos: Escasez de conjuntos de datos IR etiquetados de alta calidad;
  • Privacidad/comercial: Los datos IR de empresas farmacéuticas y petroquímicas no son públicos;
  • Integración de bases de datos: NIST, SDBS, PNNL ya están abiertos, pero con formatos diversos;
  • Dirección futura: Los principios de datos FAIR (localizables, accesibles, interoperables, reutilizables) están impulsando un ecosistema de datos abiertos.

📦 Otros recursos de código abierto:

  • OpenSpecy: análisis espectral en línea de microplásticos [14];
  • Photizo: imágenes histopatológicas FTIR [15];
  • VaporFit: sustracción atmosférica automática [16].

VIII. Herramientas de IA explicable: SHAP, LIME, visualización de atención

8.1 SHAP

SHAP (SHapley Additive exPlanations) es la herramienta de explicación de modelos más popular actualmente [17]:

  • Basado en valores de Shapley (teoría de juegos);
  • Asigna un valor SHAP a cada característica (número de onda), indicando su contribución a la predicción;
  • Visualiza "qué números de onda hicieron que el modelo predijera una clase determinada".
import shap
explainer = shap.KernelExplainer(model.predict, X_train)
shap_values = explainer.shap_values(X_test[0:5])
shap.summary_plot(shap_values, X_test[0:5], feature_names=wavenumber)

8.2 LIME

LIME (Local Interpretable Model-agnostic Explanations) aproxima localmente un modelo complejo con uno simple [18]:

  • Proporciona explicaciones locales para un solo espectro;
  • Adecuado para "¿por qué este espectro fue predicho como tal clase?".

8.3 Visualización de atención

Los mapas de atención de Transformers/CNN visualizan directamente las regiones de número de onda en las que el modelo "se enfoca" — esta es la idea central de SSIN [1].


IX. Casos prácticos de aprendizaje automático en infrarrojo

9.1 Caso 1: Espectroscopía infrarroja de suero sanguíneo para cribado de cáncer

Estudio de cribado de cáncer con espectroscopía infrarroja de suero mencionado en Ep 33 [19], utilizando SVM + PCA en 800 muestras:

  • Clases: cáncer de hígado, estómago, intestino, mama, control sano;
  • Precisión: 87%;
  • Números de onda clave: amida I (1650), amida II (1540), lípido C=O (1740);
  • Dirección futura: usar aprendizaje profundo + SSIN, esperando precisión > 95%.

9.2 Caso 2: Identificación automática de microplásticos marinos

Las imágenes μ-FTIR de microplásticos marinos generan enormes cantidades de datos (una imagen de filtro puede tener 1 millón de píxeles) [20]:

  • Método tradicional: identificación manual + búsqueda en biblioteca, 8 horas/imagen;
  • CNN automática: 5 minutos/imagen;
  • Precisión 92% (6 clases: PE/PP/PS/PET/PVC/PA);
  • Desafío clave: aumento de datos para manejar variaciones espectrales por envejecimiento del plástico.

9.3 Caso 3: Identificación automática de polimorfos de fármacos

Una empresa farmacéutica necesita identificar rápidamente 4 formas polimórficas de un fármaco [21]:

  • Datos: 1000 espectros ATR-FTIR;
  • Método: CNN + mecanismo de atención;
  • Precisión: 97%;
  • El mapa de atención muestra que el modelo se enfoca en la región 1700–1750 cm⁻¹ (frecuencia C=O varía según el polimorfo);
  • Despliegue: complementa XRD, mejora la velocidad de identificación de polimorfos 50 veces.

🔗 Lectura adicional: La relación entre polimorfos de fármacos y desplazamientos de frecuencia C=O, N-H se detalla en página de grupos carbonilo de ftir.fun y página de grupos amida de ftir.fun.


X. Perspectivas futuras

10.1 Fusión multimodal

El ML espectral futuro se dirigirá hacia la fusión multimodal:

  • IR + Raman: reglas de selección complementarias, mejoran precisión de identificación;
  • IR + MS: estructura + peso molecular;
  • IR + NMR: estructura + entorno;
  • IR + imagen: imagen química + morfología;
  • IR + literatura: datos experimentales + grafos de conocimiento.

10.2 Redes neuronales guiadas por física (PINN)

Incorporar conocimiento físico de espectroscopía (ley de Beer-Lambert, reglas de selección vibracional) como restricciones a priori en la red neuronal [22]:

  • Mejora el rendimiento con pocas muestras;
  • Garantiza plausibilidad física;
  • Aumenta la interpretabilidad.

10.3 Aprendizaje federado

Entrenamiento colaborativo entre múltiples laboratorios sin compartir datos crudos [12]:

  • Protege la privacidad comercial/de pacientes;
  • Integra datos de múltiples fuentes;
  • Ya maduro en imágenes médicas; el ámbito espectral está siguiendo.

10.4 Química cuántica + ML

Usar espectros calculados por DFT para ayudar al aprendizaje con pocas muestras [22]:

  • DFT proporciona "datos virtuales";
  • El modelo ML aprende de datos virtuales + reales;
  • Mejora la capacidad predictiva para moléculas pequeñas y compuestos raros.

10.5 Modelo base espectral universal

Están surgiendo "modelos base espectrales universales" similares a GPT [2][12]:

  • Preentrenados en enormes cantidades de datos espectrales;
  • Adaptables a tareas downstream mediante aprendizaje por indicaciones;
  • Capacidad zero-shot: incluso para compuestos no vistos pueden dar inferencias razonables.

XI. Recomendaciones prácticas

11.1 Para principiantes

  1. Primero domina la quimiometría: PCA, PLS son la base;
  2. Empieza con scikit-learn: API amigable, documentación completa;
  3. No vayas directamente a deep learning a menos que n > 1000;
  4. Prioriza la interpretabilidad: usa SHAP, LIME para que el modelo sea "explicable";
  5. Los datos son clave: ni el mejor modelo puede salvar datos deficientes.

11.2 Para investigadores

  1. Interésate por SSIN y otras IAs explicables: la investigación necesita "por qué";
  2. Participa en comunidades open-source: contribuye con datos, reporta bugs, comparte código;
  3. Colaboración interdisciplinaria: química + ciencias de la computación + estadística;
  4. Adopta los principios FAIR: haz que tus datos sean reutilizables por otros.

11.3 Para despliegue industrial

  1. Empieza con modelos simples: si puedes usar PLS, no uses CNN;
  2. Interpretabilidad primero: los escenarios de control de calidad requieren modelos auditables;
  3. Establece mecanismos de monitoreo: evalúa periódicamente la deriva del modelo;
  4. Mantén revisión humana: las decisiones críticas necesitan aprobación humana.

Ilustraciones (esquemas clave de este episodio)

📷 Figura 2026: Esquema de imágenes de microscopía/array
Fuente: Imagen real/opensource · Project case study — PE spectrum (con marca de agua ftir.fun)

Esquema de imágenes de microscopía/array

📷 Figura 2027: Cadena de métodos avanzados
Fuente: Imagen real/opensource · Unsplash — chemistry lab (con marca de agua ftir.fun)

Cadena de métodos avanzados

📷 Figura 2028: Esquema de picos característicos relacionados con técnicas avanzadas
Fuente: Diagrama educativo de ftir.fun (con marca de agua; no es espectro real, solo para entender conceptos)

Esquema de picos característicos relacionados con técnicas avanzadas

Resumen del episodio

Punto de conocimiento clave Resumen
Selección de método n < 50 usar PLS; n < 1000 usar SVM/RF; n > 1000 usar CNN/Transformer
Aprendizaje supervisado SVM (bueno con pocas muestras), RF (interpretable), XGBoost (alto rendimiento)
1D-CNN Aprendizaje automático de características; adecuado para grandes datos; propenso a sobreajuste
SSIN (2025) Aprende explícitamente regiones infrarrojas correspondientes a grupos funcionales; evidencia interpretable
LLM-IR (2025) Espectro a texto + razonamiento con grandes modelos de lenguaje; zero-shot multitarea
IR-Bot (2026) Robot autónomo + IR + ML; descubrimiento químico en ciclo cerrado
RamanBench Punto de referencia ML para espectroscopía Raman; diseño similar al infrarrojo
IA explicable SHAP, LIME, visualización de atención

| Fusión multimodal | IR + Raman/MS/NMR/imagen + literatura |
| Redes neuronales guiadas por física | Incorporar conocimiento físico de espectroscopía en ML, mejora el rendimiento con pocas muestras |
| Aprendizaje federado | Entrenamiento colaborativo entre múltiples laboratorios sin compartir datos originales |
| Modelo base espectral general | Similar a GPT, inferencia de compuestos con cero ejemplos |
| Recomendaciones prácticas | Primero dominar la quimiometría; valorar la interpretabilidad; los datos son clave |


Preguntas de reflexión

  1. Necesitas construir un modelo de clasificación para distinguir 5 tipos de plásticos (PE/PP/PS/PET/PVC), con 200 espectros ATR-FTIR. Explica qué método de aprendizaje automático (SVM/RF/CNN) elegirías y justifica tu elección.

  2. ¿Cuál es la diferencia clave entre SSIN y las CNN tradicionales en tareas de clasificación espectral? ¿Por qué la interpretabilidad de SSIN es más valiosa para la investigación científica? Proporciona un escenario científico concreto como ejemplo.

  3. El marco LLM-IR convierte espectros en texto y luego utiliza LLM para razonar. ¿Cuáles son las ventajas y limitaciones de este enfoque? Si fueras a mejorar este marco, ¿cómo combinarías SSIN con LLM?

  4. ¿Qué impacto tendrán los "laboratorios autónomos" como IR-Bot en el trabajo de los espectroscopistas infrarrojos tradicionales? Analiza desde tres perspectivas: investigación, industria y educación.

  5. ¿Por qué el campo de ML en infrarrojos ha carecido durante mucho tiempo de un estándar unificado similar a ImageNet? ¿Cómo afecta esta situación a la reproducibilidad científica? ¿Qué cambios traerá la aparición de estándares como RamanBench?


Referencias

[1] NGS00 et al. "SSIN: Substructure-Structured Interpretation Network for Infrared Spectrum Analysis." Analytical Chemistry, 2025, 97(38). DOI:10.1021/acs.analchem.5c03126.
GitHub: https://github.com/ngs00/SSIN

[2] LLM-driven IR Spectroscopy Multi-Task Reasoning Framework. arXiv:2507.21471 (2025). https://arxiv.org/abs/2507.21…

[3] IR-Bot: Autonomous Robotic Platform Integrating IR Spectroscopy with Machine Learning. CCS Chemistry, 2026. DOI:10.31635/ccschem.025.202505768.
GitHub: https://github.com/pic-ai-rob…

[4] Gerretsen J, et al. "Machine Learning in Infrared Spectroscopy: A Review." TrAC Trends in Analytical Chemistry, 2021, 135: 116156.

[5] Yang J, et al. "Deep Learning for Vibrational Spectroscopy: A Review." Analytica Chimica Acta, 2023, 1241: 340801.

[6] Acquarelli J, et al. "CNN for Spectral Data Classification." TrAC, 2017, 90: 35–48. DOI:10.1016/j.trac.2017.01.011.

[7] Breiman L. "Random Forests." Machine Learning, 2001, 45(1): 5–32.

[8] Chen T, Guestrin C. "XGBoost: A Scalable Tree Boosting System." KDD, 2016: 785–794. DOI:10.1145/2939672.2939785.

[9] Liu R, et al. "Deep Learning for Raman and IR Spectroscopy: A Review." Spectrochim Acta A, 2024, 311: 123956.

[10] Acquarelli J, et al. "CNN for Plastic Identification by ATR-FTIR." TrAC, 2017, 90: 35–48.

[11] SSIN GitHub Repository. https://github.com/ngs00/SSIN

[12] Burger B, et al. "A Mobile Robotic Chemist." Nature, 2020, 583(7815): 237–241. DOI:10.1038/s41586-020-2442-2.

[13] RamanBench: Spectral ML Benchmark Framework. GitHub: https://github.com/ml-lab-htw…

[14] OpenSpecy: Open Source Spectral Analysis for Microplastics. GitHub: https://github.com/wincowgerD…

[15] Photizo: FTIR Tissue Pathology. Bioinformatics, 2022, 38(13): 3490. GitHub: https://github.com/DendrouLab…

[16] VaporFit: Auto Atmospheric Subtraction. Phys Chem Chem Phys, 2025, 27. GitHub: https://github.com/piobruzd/V…

[17] Lundberg S M, Lee S I. "A Unified Approach to Interpreting Model Predictions." NeurIPS, 2017: 4765–4774.

[18] Ribeiro M T, Singh S, Guestrin C. "'Why Should I Trust You?': Explaining the Predictions of Any Classifier." KDD, 2016: 1135–1144.

[19] Baker M J, et al. "Using FTIR Spectroscopy to Diagnose Cancer." Nature Protocols, 2014, 9(8): 1771–1791.

[20] Primpke S, et al. "Microplastic Identification via FPA-FTIR Microscopy." Anal Methods, 2020, 12(4): 5269–5281.

[21] Aaltonen J, et al. "Polymorphism Screening via IR and Machine Learning." J Pharm Sci, 2022, 111(2): 432–440.

[22] Karniadakis G E, et al. "Physics-Informed Machine Learning." Nature Reviews Physics, 2021, 3(6): 422–440.

[23] ftir.fun 羰基官能团页. https://ftir.fun/ir/group/car…

[24] ftir.fun 羟基官能团页. https://ftir.fun/ir/group/hyd…

[25] ftir.fun 胺官能团页. https://ftir.fun/ir/group/ami…

[26] ftir.fun Página del grupo funcional amida. https://ftir.fun/ir/group/ami…

[27] ftir.fun Página del grupo funcional alquilo C-H. https://ftir.fun/ir/group/alk…


Avance del próximo episodio: Ep 45 — Espectroscopía infrarroja in situ/operando: Estudio de mecanismos de reacciones catalíticas
El aprendizaje automático es una nueva vía "impulsada por datos" para el infrarrojo, mientras que el infrarrojo in situ es la vía clásica "impulsada por mecanismos". El próximo episodio es el cierre de la serie avanzada: explicaremos sistemáticamente el diseño de celdas infrarrojas in situ (alta temperatura y presión, vacío, flujo), DRIFTS in situ para catálisis, celdas de transmisión in situ, interfaz líquido-sólido ATR in situ, el concepto de espectroscopía operando, el mecanismo de adsorción y oxidación de CO en Pt/Al₂O₃, y el uso de la molécula sonda CO para inferir la dispersión metálica, entre otros conocimientos clave.


Este artículo está bajo licencia CC BY-NC-SA 4.0. Las imágenes provienen de dominio público o de recursos en línea con fuentes indicadas; los derechos de autor pertenecen a sus respectivos autores.

Enviar solicitud Formulario