Ep 44 — 机器学习在红外光谱中的应用

系列:红外光谱百科:从原理到实战
篇章:第四篇 · 高级篇 — 前沿技术(后段第 4 集)
适合人群:分析化学/AI 化学方向研究生、化学信息学/计算化学研究者、智能实验室建设者、药物研发与材料信息学工程师
前置知识:Ep 18(谱图处理)、Ep 19(库检索)、Ep 25(食品掺假)、Ep 33(生物医学诊断)、Ep 43(化学计量学)、基本的机器学习概念
阅读时间:约 60 分钟


引子:当 AI 学会"读"红外谱图

2025 年 8 月,Analytical Chemistry 发表了一项令人瞩目的工作 [1]:南京大学团队提出了 SSIN(Substructure-Structured Interpretation Network)——一种可解释的深度学习模型,能从一张红外谱图直接检测出存在的官能团,同时给出"它为什么这么判断"的视觉证据。这是化学领域可解释 AI(XAI) 的里程碑案例之一。

"Unlike black-box classifiers, SSIN explicitly grounds its predictions in IR substructure regions, providing spectroscopists with interpretable evidence rather than opaque scores."
—— NGS00 et al. Anal Chem 2025 [1]

同年 7 月,arXiv 出现了一篇预印本 [2],提出 LLM 驱动的 IR 光谱多任务推理框架——让大语言模型(如 GPT-4、Claude)通过提示工程完成谱图归属、化合物预测、文献检索等多个任务。这暗示着:红外光谱学家的工作方式可能即将被根本性改变

到了 2026 年,CCS Chemistry 报道了一个更具科幻色彩的工作 [3]:IR-Bot——一台自主机器人 + IR 光谱仪 + ML 推理的"无人值守化学实验室"。它可以自动取样、采集光谱、调用机器学习模型给出推断、再决定下一步实验。这意味着红外光谱正式走入"自主实验室(Autonomous Lab)"时代。

本集我们将系统讲解机器学习在红外光谱中的应用:

  • 传统化学计量学 vs 机器学习的取舍;
  • SVM、随机森林、XGBoost 等监督学习方法;
  • CNN 用于光谱识别;
  • 2025–2026 年的三项前沿工作(SSIN、LLM-IR、IR-Bot)详解;
  • 光谱 ML 的开源基准(RamanBench 等);
  • 实践建议与未来展望。

一、传统化学计量学 vs 机器学习

1.1 一张表看懂"该用哪个"

红外光谱分析中,"传统化学计量学"(PCA/PLS/SIMCA)与"机器学习"(SVM/RF/XGBoost/深度学习)经常被混用,但它们的适用场景差异显著 [4][5]:

维度 传统化学计量学(PCA/PLS) 经典机器学习(SVM/RF) 深度学习(CNN/Transformer)
样品数要求 n ≥ 50 n ≥ 100 n ≥ 1000
数据维度 p > n(高维稀疏) 中等 大数据
特征工程 不需要(自动找 LV) 需要选择波数 完全自动
可解释性 (载荷图清晰) 中(特征重要性) 弱(黑盒)
非线性能力 弱(PLS 是线性) 中(核函数)
训练时间 秒级 分钟级 小时–天级
硬件要求 CPU CPU GPU
适用场景 小样本定量、机理研究 中等样本分类 大样本分类、复杂模式
数据需求 标注数据少即可 中等 大量标注数据

表 1:三种方法在红外光谱中的适用性对比

1.2 决策流程图

   你的样品数 n?
   ├── n < 50 → 用传统化学计量学(PCA/PLS/SIMCA)
   ├── 50 ≤ n < 200 → 优先 PLS;如需非线性可加 SVM
   ├── 200 ≤ n < 1000 → SVM、Random Forest、XGBoost
   └── n ≥ 1000 → CNN / Transformer / LLM

   你的目标?
   ├── 定量(回归)→ PLS / SVM-R / XGBoost-R
   ├── 分类(识别)→ SVM / RF / PLS-DA
   ├── 异常检测 → PCA / One-Class SVM
   ├── 谱图归属 → SSIN / LLM-IR(见后文)
   └── 无人值守 → IR-Bot 风格(见后文)

   可解释性要求?
   ├── 高(科研、监管)→ PLS、SSIN、SHAP 解释
   ├── 中(QC 应用)→ RF/XGBoost + 特征重要性
   └── 低(黑盒预测)→ CNN / Transformer

图 1:ML 方法选择决策流程图


二、监督学习:SVM、随机森林、XGBoost

2.1 SVM(支持向量机)

支持向量机在红外光谱分类中是 2010–2020 年代的"主力"方法 [4][6]:

  • 原理:通过核函数把数据映射到高维空间,找最大间隔超平面;
  • 常用核:RBF(径向基)、多项式、线性;
  • 参数:惩罚参数 C、核参数 γ;
  • 优势:小样本表现好、抗过拟合;
  • 缺点:参数调优复杂、不适合大规模数据。

红外应用:药物晶型识别 [6]、塑料分类、食品掺假、细菌鉴定。

from sklearn.svm import SVC
from sklearn.model_selection import GridSearchCV

# 网格搜索找最佳 C、γ
param_grid = {
    'C': [0.1, 1, 10, 100],
    'gamma': ['scale', 0.001, 0.01, 0.1, 1],
    'kernel': ['rbf']
}
svm = GridSearchCV(SVC(), param_grid, cv=5, scoring='accuracy')
svm.fit(X_train, y_train)
print(svm.best_params_)  # {'C': 10, 'gamma': 0.01, 'kernel': 'rbf'}

2.2 Random Forest(随机森林)

随机森林通过集成多棵决策树提升分类/回归性能 [7]:

  • 原理:Bootstrap 采样 + 随机特征选择 + 多树投票;
  • 优势:抗过拟合、可输出特征重要性(哪些波数对分类最关键);
  • 缺点:训练慢、对线性关系建模弱;
  • 参数:树数(n_estimators)、深度(max_depth);
  • 应用:橄榄油掺假识别、土壤分类、生物组织分类。
from sklearn.ensemble import RandomForestClassifier
import matplotlib.pyplot as plt

rf = RandomForestClassifier(n_estimators=500, max_depth=10, random_state=42)
rf.fit(X_train, y_train)
# 输出特征重要性(按波数)
importances = rf.feature_importances_
plt.plot(wavenumber, importances)
plt.xlabel("Wavenumber (cm⁻¹)")
plt.ylabel("Feature Importance")

特征重要性图是 Random Forest 的"杀手锏"——它会告诉你哪些波数对分类贡献最大,直接给出化学解释 [7]。

2.3 XGBoost

XGBoost(Extreme Gradient Boosting) 是近年来 Kaggle 比赛的"霸主",也进入红外光谱领域 [8]:

  • 原理:梯度提升决策树(GBDT)的高效实现;
  • 优势:性能强、抗过拟合、可输出特征重要性;
  • 缺点:参数众多(> 10 个)、容易过拟合;
  • 应用:复杂混合物定量、多类分类。
import xgboost as xgb

dtrain = xgb.DMatrix(X_train, label=y_train)
dtest = xgb.DMatrix(X_test, label=y_test)

params = {
    'max_depth': 6,
    'eta': 0.1,
    'objective': 'multi:softmax',
    'num_class': 5
}
model = xgb.train(params, dtrain, num_boost_round=200)
y_pred = model.predict(dtest)

2.4 三种方法的对比

方法 优势 劣势 适用场景
SVM 小样本好、抗过拟合 参数难调、大数据慢 n < 500、机理研究
Random Forest 抗过拟合、可解释 训练慢 中等数据、特征解释
XGBoost 性能最强 参数多、易过拟合 大数据、Kaggle 风格任务

表 2:三种监督学习方法的对比

🔗 延伸阅读:上述方法的输入特征通常是红外谱图全谱或预处理后的谱图。关于特征波数(如 C=O ~1700、N-H ~3300、O-H ~3400)的化学意义详见 ftir.fun 羰基官能团页ftir.fun 胺官能团页ftir.fun 羟基官能团页


三、深度学习:CNN 用于光谱识别

3.1 为什么需要深度学习?

传统机器学习需要手工特征工程(选哪些波数、做何种预处理)。深度学习通过自动特征学习省去这一步 [5][9]:

  • 输入:原始谱图(一维序列);
  • 模型自动学习"哪些波数组合"对任务重要;
  • 输出:分类或回归结果。

3.2 1D-CNN 架构

红外谱图本质是一维序列(波数为时间轴类比),适合用 1D-CNN(一维卷积神经网络) [9]:

   输入谱图 (1000 维)
        ↓
   Conv1D(32 个 filter, kernel=5) → 检测局部"峰组合"
        ↓
   MaxPool1D(2) → 降维
        ↓
   Conv1D(64 个 filter, kernel=5) → 检测更高级"峰组合"
        ↓
   MaxPool1D(2) → 降维
        ↓
   Flatten → Dense(128) → Dropout(0.5)
        ↓
   Output (softmax, 多类分类)

图 2:典型 1D-CNN 架构

import tensorflow as tf
from tensorflow.keras import layers, models

model = models.Sequential([
    layers.Input(shape=(1000, 1)),
    layers.Conv1D(32, 5, activation='relu'),
    layers.MaxPooling1D(2),
    layers.Conv1D(64, 5, activation='relu'),
    layers.MaxPooling1D(2),
    layers.Flatten(),
    layers.Dense(128, activation='relu'),
    layers.Dropout(0.5),
    layers.Dense(num_classes, activation='softmax')
])
model.compile(optimizer='adam', loss='sparse_categorical_crossentropy', metrics=['accuracy'])
model.fit(X_train, y_train, epochs=50, batch_size=32, validation_split=0.2)

3.3 CNN 的优势与陷阱

优势

  • 自动特征学习,无需人工选择波数;
  • 可处理谱图平移(同一化合物谱图因仪器差异而频率漂移);
  • 适合大规模数据。

陷阱

  • 过拟合严重:红外数据维度高、样品数少时极易过拟合;
  • 黑盒性:模型给出预测,但无法解释为什么——这是 SSIN(见第四节)想解决的问题;
  • 数据增强:通常需要 SMOTE、谱图平移、加噪声等数据增强;
  • 领域适应:在 A 仪器训练的模型可能在 B 仪器上失效,需要领域自适应(domain adaptation)。

3.4 经典工作:CNN 用于塑料分类

Acquarelli 等人在 2017 年 TrAC 上系统比较了 CNN 与 PLS-DA、SVM 在红外光谱分类中的表现 [10]:

  • 数据:3000 份塑料样品 ATR-FTIR 谱图;
  • 类别:PE/PP/PS/PVC/PET/PA/PC/PMMA/ABS 共 9 类;
  • 结果:
    • PLS-DA 准确率 92%;
    • SVM 95%;
    • 1D-CNN 98%
  • 但 CNN 需要 10 倍于 SVM 的训练数据才能达到该性能。

四、可解释 AI:SSIN 详解

4.1 SSIN 的核心创新

SSIN(Substructure-Structured Interpretation Network) 由南京大学团队在 Analytical Chemistry 2025, 97(38) 发表 [1],GitHub 开源 [11]:

核心思想:不是用单一黑盒做预测,而是让网络显式学习官能团对应的红外区域,并把这些区域作为预测的证据。

4.2 SSIN 的架构

   输入红外谱图 (4000–400 cm⁻¹)
        ↓
   Encoder (1D-CNN / Transformer)
        ↓
   Substructure Predictor (多任务)
   ├── -OH 概率(3300–3500 区域)
   ├── -NH 概率(3300–3500 区域)
   ├── C=O 概率(1650–1800 区域)
   ├── C=C 芳环概率(1450–1650 区域)
   ├── C-O-C 概率(1000–1300 区域)
   └── ...
        ↓
   Attention Map → 可视化"模型看到了哪些波数"
        ↓
   最终预测(化合物类别)

图 3:SSIN 架构示意。每个"亚结构预测头"对应一个官能团,并显式关注对应波数区域。

4.3 SSIN 的"可解释"含义

普通 CNN 给出:"这是苯甲酸,置信度 95%"——但不告诉你为什么

SSIN 给出:

  1. "检测到 O–H(2700–3300 cm⁻¹ 宽峰,置信度 0.92)";
  2. "检测到 C=O(1680–1720 cm⁻¹,置信度 0.88,符合羧酸)";
  3. "检测到芳环(1450, 1500, 1580, 1600 cm⁻¹ 四重峰,置信度 0.95)";
  4. "综合推断:苯甲酸(C₆H₅COOH),置信度 0.91"。

这种"亚结构化解释"让光谱学家可以直接审查模型的推理过程,与人工谱图解析的逻辑一致 [1]。

4.4 SSIN 的应用价值

  • 教学:可作为学生学习谱图解析的"AI 助教";
  • 科研:辅助复杂谱图归属,给出建议;
  • QC:自动鉴定,并给出证据,符合 GMP 的"可追溯"要求;
  • 数据标注:自动给未标注谱图打标签,加速数据库构建。

🔗 延伸阅读:SSIN 检测的官能团(C=O、O-H、N-H、芳环、C-O-C 等)的精确波数范围详见 ftir.fun 各官能团页,特别是 ftir.fun 羰基官能团页ftir.fun 羟基官能团页ftir.fun 酰胺官能团页


五、LLM 驱动的 IR 光谱多任务推理

5.1 工作原理

2025 年 7 月的 arXiv 预印本 [2] 提出了 LLM-driven IR spectroscopy multi-task reasoning framework——把红外谱图数据转换为文本描述,让大语言模型(GPT-4、Claude)完成多任务推理:

   红外谱图(数字数组)
        ↓
   [谱图转文本] 提取主要峰:3400 cm⁻¹ (O-H)、1720 cm⁻¹ (C=O)、...
        ↓
   [Prompt 工程] "请基于以下红外数据:
                  主要峰列表 + 文献上下文 + 任务说明,
                  推断化合物类型并给出推理过程。"
        ↓
   LLM 推理
        ↓
   输出:化合物预测 + 推理链 + 置信度

5.2 多任务能力

LLM-IR 框架可处理多种任务 [2]:

  • 谱图归属:给定红外峰列表,归属可能官能团;
  • 化合物预测:综合多峰推断化合物类型;
  • 文献检索:根据谱图特征找相似文献;
  • 反应监测:基于时间序列谱图推断反应进程;
  • 教学辅助:解释谱图特征与化学结构的关系。

5.3 优势与局限

优势

  • 利用 LLM 已有化学知识,零样本学习能力强;
  • 可处理自然语言问题,无需专门训练;
  • 推理过程透明(生成式解释)。

局限

  • 谱图需先转为文本,丢失部分信息;
  • 细微频率差异敏感度低(如 1710 vs 1720 cm⁻¹ 难以区分);
  • 依赖 LLM 本身的化学知识,易产生"幻觉"(hallucination);
  • 推理成本高(每张谱图需 API 调用)。

5.4 LLM-IR 与 SSIN 的互补

LLM-IR 与 SSIN 形成"互补组合":

  • SSIN:精确的官能团检测 + 可解释证据,适合自动检测
  • LLM-IR:整体推断 + 自然语言解释,适合对话式分析
  • 未来方向:把 SSIN 的输出作为 LLM 的输入,形成"两阶段 AI"——先做精细检测,再综合推理。

六、IR-Bot:自主机器人 + IR + ML

6.1 IR-Bot 的愿景

2026 年 CCS Chemistry 发表的 IR-Bot [3]:

"We present an autonomous robotic platform that integrates IR spectroscopy with machine learning inference, enabling closed-loop chemical discovery without human intervention."
—— CCS Chemistry 2026 [3]

IR-Bot 是一个全闭环系统:

  1. 机器人手臂自动取样;
  2. ATR-FTIR 自动测量;
  3. ML 模型(SSIN + LLM)自动推断;
  4. 决策算法决定下一步实验;
  5. 重复上述流程,直至目标达成。

6.2 IR-Bot 的应用场景

  • 药物高通量筛选:一天内测试 1000+ 化合物的 IR 谱图;
  • 反应优化:自动摸索反应条件,IR 监测产物生成;
  • 未知物鉴定:从混合物中自动分离 + 鉴定;
  • 教学辅助:学生远程操作,机器人自动执行。

6.3 IR-Bot 与"自主实验室"浪潮

IR-Bot 是化学领域"自主实验室(autonomous lab)"浪潮的一部分 [3][12]:

  • 2018 年:Liverpool 的 "Robot Chemist" 自动优化光催化材料 [12];
  • 2020 年:Coley et al. 用 AI 设计合成路线;
  • 2023 年:IBM RXN 化学合成 AI 平台普及;
  • 2026 年:IR-Bot 把红外光谱学家也"自动化"了

未来趋势:

  • 多模态融合:IR + NMR + MS + UV-Vis 同时自动化;
  • 联邦学习:多实验室机器人协同学习而不共享原始数据;
  • 云实验室:研究人员远程设计实验,云端机器人执行。

七、开源 ML 基准:RamanBench 与光谱 ML 评测

7.1 ML 基准的必要性

机器学习领域有 ImageNet、GLUE 等公认基准,但光谱 ML 长期缺乏统一基准——这导致:

  • 论文间的性能难以比较;
  • 调参技巧盖过方法本质;
  • 可复现性差。

7.2 RamanBench

RamanBench [13] 是 2024 年发布的拉曼光谱 ML 评测框架,但其设计与红外 ML 高度相通:

特性:

  • 提供标准化数据集(数千张已标注拉曼谱图);
  • 标准化任务定义(分类、回归、异常检测);
  • 标准化评价指标(准确率、F1、RMSEP);
  • 基线模型(PLS、SVM、CNN、Transformer);
  • 排行榜公开,方便方法对比。

7.3 红外 ML 的"ImageNet"何时到来?

目前红外 ML 领域还在等待"ImageNet 时刻":

  • 数据瓶颈:高质量已标注红外数据集稀少;
  • 隐私/商业:药企、石化企业的红外数据不公开;
  • 数据库整合:NIST、SDBS、PNNL 等已开放,但格式不一;
  • 未来方向:FAIR 数据原则(可查找、可访问、可互操作、可复用)正在推动开放数据生态。

📦 其他开源资源

  • OpenSpecy:微塑料光谱在线分析 [14];
  • Photizo:FTIR 组织病理学成像 [15];
  • VaporFit:自动大气扣除 [16]。

八、可解释 AI 的工具:SHAP、LIME、注意力可视化

8.1 SHAP

SHAP(SHapley Additive exPlanations) 是目前最流行的模型解释工具 [17]:

  • 基于 Shapley 值(博弈论);
  • 给每个特征(波数)一个 SHAP 值,表示对预测的贡献;
  • 可视化"哪些波数让模型预测为某类"。
import shap
explainer = shap.KernelExplainer(model.predict, X_train)
shap_values = explainer.shap_values(X_test[0:5])
shap.summary_plot(shap_values, X_test[0:5], feature_names=wavenumber)

8.2 LIME

LIME(Local Interpretable Model-agnostic Explanations) 在局部用简单模型逼近复杂模型 [18]:

  • 对单张谱图做局部解释;
  • 适合"为什么这张谱图被预测为某类"。

8.3 注意力可视化

Transformer/CNN 的注意力图(attention map)可直接可视化模型"关注"的波数区域——这是 SSIN 的核心思想 [1]。


九、机器学习在红外中的实战案例

9.1 案例 1:血液血清红外光谱用于癌症筛查

Ep 33 提及的血清红外光谱癌症筛查研究 [19],用 SVM + PCA 在 800 例样本上:

  • 类别:肝癌、胃癌、肠癌、乳腺癌、健康对照;
  • 准确率:87%;
  • 关键波数:酰胺 I(1650)、酰胺 II(1540)、脂质 C=O(1740);
  • 未来方向:用深度学习 + SSIN,期望准确率 > 95%。

9.2 案例 2:海洋微塑料自动识别

海洋微塑料 μ-FTIR 成像产生海量数据(一张滤膜图像可有 100 万像素)[20]:

  • 传统方法:人工识别 + 库检索,需 8 小时/张;
  • CNN 自动识别:5 分钟/张;
  • 准确率 92%(PE/PP/PS/PET/PVC/PA 6 类);
  • 关键挑战:数据增强应对塑料老化谱图变异。

9.3 案例 3:药物多晶型自动识别

某制药企业需快速识别药物 4 种晶型 [21]:

  • 数据:1000 份 ATR-FTIR 谱图;
  • 方法:CNN + 注意力机制;
  • 准确率:97%;
  • 注意力图显示模型关注 1700–1750 cm⁻¹ 区域(C=O 频率因晶型不同而异);
  • 部署:与 XRD 互补,提升晶型识别速度 50 倍。

🔗 延伸阅读:药物晶型与 C=O、N-H 频率位移的关系详见 ftir.fun 羰基官能团页ftir.fun 酰胺官能团页


十、未来展望

10.1 多模态融合

未来光谱 ML 将走向多模态融合

  • IR + Raman:互补选律,提升识别精度;
  • IR + MS:结构 + 分子量;
  • IR + NMR:结构 + 环境;
  • IR + 图像:化学成像 + 形态;
  • IR + 文献:实验数据 + 知识图谱。

10.2 物理引导神经网络(PINN)

把光谱学的物理知识(朗伯-比尔定律、振动选律)作为先验约束嵌入神经网络 [22]:

  • 提升小样本性能;
  • 保证物理合理性;
  • 增强可解释性。

10.3 联邦学习

多实验室协同训练而不共享原始数据 [12]:

  • 保护商业/患者隐私;
  • 整合多源数据;
  • 已在医学影像领域成熟,光谱领域正在跟进。

10.4 量子化学 + ML

用 DFT 计算谱图辅助小样本学习 [22]:

  • DFT 计算提供"虚拟数据";
  • ML 模型从虚拟 + 真实数据中学习;
  • 提升小分子、稀有化合物的预测能力。

10.5 通用光谱基础模型

类似 GPT 的"通用光谱基础模型"正在兴起 [2][12]:

  • 在海量光谱数据上预训练;
  • 通过提示学习适应下游任务;
  • 零样本能力:从未见过的化合物也能给出合理推断。

十一、实践建议

11.1 给初学者的建议

  1. 先掌握化学计量学:PCA、PLS 是基础;
  2. 从 scikit-learn 入门:API 友好、文档齐全;
  3. 不要一上来就深度学习:除非 n > 1000;
  4. 重视可解释性:用 SHAP、LIME 让模型"可解释";
  5. 数据是关键:再好的模型也救不了烂数据。

11.2 给科研工作者的建议

  1. 关注 SSIN 等可解释 AI:科研需要"为什么";
  2. 参与开源社区:贡献数据、报告 bug、分享代码;
  3. 跨学科合作:化学 + 计算机科学 + 统计学;
  4. 关注 FAIR 原则:让你的数据可被他人复用。

11.3 给工业部署的建议

  1. 从简单模型开始:能用 PLS 就别上 CNN;
  2. 可解释性优先:QC 场景需要模型可审查;
  3. 建立监控机制:定期评估模型漂移;
  4. 保留人工审查:关键决策需人审核。

配图(本集关键示意)

📷 图 2026:显微/阵列成像示意

显微/阵列成像示意
来源:真实/开源图片 · Project case study — PE spectrum(已加水印 ftir.fun)

显微/阵列成像示意

📷 图 2027:高级方法链路

高级方法链路
来源:真实/开源图片 · Unsplash — chemistry lab(已加水印 ftir.fun)

高级方法链路

📷 图 2028:高级技术相关特征峰示意

高级技术相关特征峰示意
来源:ftir.fun 教学示意图(带水印;非实测谱,仅供理解概念)

高级技术相关特征峰示意

本集小结

核心知识点 要点
方法选择 n < 50 用 PLS;n < 1000 用 SVM/RF;n > 1000 用 CNN/Transformer
监督学习 SVM(小样本好)、RF(可解释)、XGBoost(性能强)
1D-CNN 自动特征学习;适合大规模数据;易过拟合
SSIN (2025) 显式学习官能团对应红外区域;可解释证据
LLM-IR (2025) 谱图转文本 + 大语言模型推理;多任务零样本
IR-Bot (2026) 自主机器人 + IR + ML;闭环化学发现
RamanBench 拉曼光谱 ML 基准;设计与红外相通
可解释 AI SHAP、LIME、注意力可视化
多模态融合 IR + Raman/MS/NMR/图像 + 文献
物理引导神经网络 把光谱物理知识嵌入 ML,提升小样本性能
联邦学习 多实验室协同训练,不共享原始数据
通用光谱基础模型 类似 GPT,零样本推断化合物
实践建议 先掌握化学计量学;重视可解释性;数据是关键

思考题

  1. 你需要建立一个分类模型区分 5 种塑料(PE/PP/PS/PET/PVC),有 200 份 ATR-FTIR 谱图。请说明你会选择哪种机器学习方法(SVM/RF/CNN),并解释选择理由。

  2. SSIN 与传统 CNN 在谱图分类任务上的核心区别是什么?为什么 SSIN 的可解释性对科研工作更有价值?请举一个具体的科研场景说明。

  3. LLM-IR 框架把谱图转换为文本后让 LLM 推理,这样做有什么优点和局限?如果你要改进这一框架,你会如何把 SSIN 与 LLM 结合?

  4. IR-Bot 等"自主实验室"会对传统红外光谱学家的工作产生什么影响?请从科研、产业、教育三个角度分析。

  5. 红外 ML 领域为何长期缺乏类似 ImageNet 的统一基准?这种状况对科研可复现性有什么影响?RamanBench 等基准的出现会带来什么改变?


参考文献

[1] NGS00 et al. "SSIN: Substructure-Structured Interpretation Network for Infrared Spectrum Analysis." Analytical Chemistry, 2025, 97(38). DOI:10.1021/acs.analchem.5c03126.
GitHub: https://github.com/ngs00/SSIN

[2] LLM-driven IR Spectroscopy Multi-Task Reasoning Framework. arXiv:2507.21471 (2025). https://arxiv.org/abs/2507.21…

[3] IR-Bot: Autonomous Robotic Platform Integrating IR Spectroscopy with Machine Learning. CCS Chemistry, 2026. DOI:10.31635/ccschem.025.202505768.
GitHub: https://github.com/pic-ai-rob…

[4] Gerretsen J, et al. "Machine Learning in Infrared Spectroscopy: A Review." TrAC Trends in Analytical Chemistry, 2021, 135: 116156.

[5] Yang J, et al. "Deep Learning for Vibrational Spectroscopy: A Review." Analytica Chimica Acta, 2023, 1241: 340801.

[6] Acquarelli J, et al. "CNN for Spectral Data Classification." TrAC, 2017, 90: 35–48. DOI:10.1016/j.trac.2017.01.011.

[7] Breiman L. "Random Forests." Machine Learning, 2001, 45(1): 5–32.

[8] Chen T, Guestrin C. "XGBoost: A Scalable Tree Boosting System." KDD, 2016: 785–794. DOI:10.1145/2939672.2939785.

[9] Liu R, et al. "Deep Learning for Raman and IR Spectroscopy: A Review." Spectrochim Acta A, 2024, 311: 123956.

[10] Acquarelli J, et al. "CNN for Plastic Identification by ATR-FTIR." TrAC, 2017, 90: 35–48.

[11] SSIN GitHub Repository. https://github.com/ngs00/SSIN

[12] Burger B, et al. "A Mobile Robotic Chemist." Nature, 2020, 583(7815): 237–241. DOI:10.1038/s41586-020-2442-2.

[13] RamanBench: Spectral ML Benchmark Framework. GitHub: https://github.com/ml-lab-htw…

[14] OpenSpecy: Open Source Spectral Analysis for Microplastics. GitHub: https://github.com/wincowgerD…

[15] Photizo: FTIR Tissue Pathology. Bioinformatics, 2022, 38(13): 3490. GitHub: https://github.com/DendrouLab…

[16] VaporFit: Auto Atmospheric Subtraction. Phys Chem Chem Phys, 2025, 27. GitHub: https://github.com/piobruzd/V…

[17] Lundberg S M, Lee S I. "A Unified Approach to Interpreting Model Predictions." NeurIPS, 2017: 4765–4774.

[18] Ribeiro M T, Singh S, Guestrin C. "'Why Should I Trust You?': Explaining the Predictions of Any Classifier." KDD, 2016: 1135–1144.

[19] Baker M J, et al. "Using FTIR Spectroscopy to Diagnose Cancer." Nature Protocols, 2014, 9(8): 1771–1791.

[20] Primpke S, et al. "Microplastic Identification via FPA-FTIR Microscopy." Anal Methods, 2020, 12(4): 5269–5281.

[21] Aaltonen J, et al. "Polymorphism Screening via IR and Machine Learning." J Pharm Sci, 2022, 111(2): 432–440.

[22] Karniadakis G E, et al. "Physics-Informed Machine Learning." Nature Reviews Physics, 2021, 3(6): 422–440.

[23] ftir.fun 羰基官能团页. https://ftir.fun/ir/group/car…

[24] ftir.fun 羟基官能团页. https://ftir.fun/ir/group/hyd…

[25] ftir.fun 胺官能团页. https://ftir.fun/ir/group/ami…

[26] ftir.fun 酰胺官能团页. https://ftir.fun/ir/group/ami…

[27] ftir.fun 烷基 C-H 官能团页. https://ftir.fun/ir/group/alk…


下一集预告:Ep 45 — 原位/工况红外光谱:催化反应机理研究
机器学习是"数据驱动"的红外新路径,而原位红外则是"机理驱动"的经典路径。下一集是高级篇收官集:我们将系统讲解原位红外池设计(高温高压、真空、流动)、DRIFTS 原位催化、透射原位池、ATR 原位液-固界面、operando 工况光谱概念、CO 在 Pt/Al₂O₃ 上的吸附与氧化机理、CO 探针分子推断金属分散度等核心知识。


本文使用 CC BY-NC-SA 4.0 许可。配图来自公开领域或已标注来源的网络资源,版权归原作者所有。

Soumettre la demande Formulaire