BatteryLife:面向电池寿命预测的综合数据集与基准测试
原文标题:BatteryLife: A Comprehensive Dataset and Benchmark for Battery Life Prediction
作者:Ruifeng Tan, Weixiang Hong, Jiayue Tang, Xibin Lu, Ruijun Ma, Xiang Zheng, Jia Li, Jiaqiang Huang, Tong-Yi Zhang
机构:香港科技大学(广州)/ 香港科技大学 / 中创新航科技集团股份有限公司
会议:KDD '25, 2025年8月3-7日, 多伦多, 加拿大
arXiv:2502.18807v7 [cs.LG] 2025年11月12日
代码仓库:https://github.com/Ruifeng-Tan/BatteryLife
摘要
电池寿命预测(Battery Life Prediction, BLP)依赖于电池退化测试产生的时间序列数据,对于电池的使用、优化和生产至关重要。尽管该领域取得了显著进展,但仍面临三个关键挑战。首先,现有数据集规模有限,阻碍了对现代电池寿命数据的深入理解。其次,大多数数据集仅涵盖在实验室中、在有限的多样性条件下测试的小容量锂离子电池,引发了对研究结论泛化能力的担忧。第三,不同研究间不一致且有限的基准测试模糊了基线方法的有效性,也不清楚在其他时间序列领域流行的模型是否适用于BLP。为应对这些挑战,我们提出了BatteryLife——一个面向BLP的综合数据集与基准测试。BatteryLife集成了16个数据集,样本量是此前最大数据集的2.5倍,并提供了最多样化的电池寿命资源,涵盖8种电池形态、59种化学体系、9种工作温度和421种充放电协议,包括实验室测试和工业测试。值得注意的是,BatteryLife首次发布了锌离子电池、钠离子电池和工业测试的大容量锂离子电池的寿命数据集。基于这一综合数据集,我们重新审视了在本领域及其他时间序列领域流行的基线方法的有效性。此外,我们提出了CyclePatch——一种可应用于各种神经网络的插件技术。对18种方法的综合基准测试揭示了一个事实:在其他时间序列领域流行的模型可能不适合BLP,而CyclePatch能持续提升模型性能,建立了最先进的基准。此外,BatteryLife还评估了模型在不同老化条件和跨领域下的表现。BatteryLife已在 https://github.com/Ruifeng-Tan/BatteryLife 公开。
关键词:时间序列;电池;化学人工智能;材料信息学
1 引言
可充电电池在现代工业中无处不在,包括电动汽车、电网和便携设备[13, 26, 37]。然而,由于内在的电化学机制[4, 7, 35],电池在循环操作中不可避免地会退化。这种退化导致可用时间缩短,并可能在应用中引发安全问题[50, 52]。通常,当电池容量降至初始容量的80%时,即被视为达到寿命终点(end-of-life),而寿命终点的电池不再适合电动汽车等高要求应用[2, 27, 33]。为确保更可持续和更安全的电池运行,电池工程师/科学家需要通过退化测试来测量电池寿命,以进行电池优化和质量控制[2, 21, 34]。然而,退化测试非常耗时,因为非线性的容量损失会在数月甚至数年内逐渐发生,直到寿命终结。因此,准确预测电池寿命的早期预测对于电池的使用、优化和生产至关重要。
机器学习模型已被开发为电池寿命预测(BLP)的有前途的方法[8, 11, 12, 15, 27, 31, 33, 38, 44, 51, 54, 55]。在早期工作中,电池专家通常基于领域知识,从电压和电流时间序列[15, 33]以及温度测试[53]和声学测试[20]等附加测试数据中艰苦地提取特征。提取的特征随后被输入到经典机器学习模型(如高斯过程回归器)中以预测电池寿命。近年来,随着更大数据集的出现,神经网络在不需要深厚领域专业知识的情况下展现出了优于经典机器学习模型的优势[8, 27, 36, 38, 48, 51]。尽管这些方法取得了成功,但也揭示了阻碍该领域发展的三个问题:
- 数据集规模有限。 如表1所示,此前最大的数据集是BatteryML[50],通过整合7个公开数据集[2, 6, 16, 17, 22, 27, 30, 33]提供了381块寿命终点电池。然而,该工作忽略了一些数据集[28, 44, 56],且缺乏近期发布的数据集[5, 21, 40]。因此,BatteryML的规模不到现有数据集总和的一半,无法提供对现代电池寿命数据的全面洞察。
- 数据多样性有限。 根据表1,大多数现有电池寿命数据集仅提供一种形态、一种化学体系、一种工作温度和若干充放电协议的锂离子电池。BatteryML[50]和ISU_ILCC[21]在充放电协议方面提供了较好的多样性,但其他方面的多样性仍然有限。研究者[27]观察到,在各种充电协议上验证的模型可能无法有效学习不同的放电协议。这引发了对从有限多样性数据集中得出的研究结论泛化能力的担忧。此外,有限的多样性也导致缺乏能够启发更广泛电池研究方向的数据。
- 基准不一致且有限。 现有工作[8, 11, 12, 15, 27, 33, 44, 51, 54, 55]通常使用不同数据集和不同实验设置(如不同的基线和数据预处理)来评估模型。此外,这些研究使用跨越不同循环次数的数据进行预测,从单个循环[11]到一百个循环[33, 51]不等,导致任务设置不统一。而且,当前的基准测试通常只采用有限的经典基线集合(如原始循环神经网络)。这种缺乏一致和全面基准的状况使得难以评估该领域的基线方法,也不清楚在其他时间序列领域(如天气、交通和电力)流行的模型是否适用于BLP。
为解决这些问题,我们提出了BatteryLife——一个面向BLP的综合数据集和基准测试。从数据集角度来看,BatteryLife通过整合16个数据集,脱颖而出成为最大和最多样化的电池寿命数据集。具体而言,BatteryLife在电池数量上是BatteryML[50]的2.5倍,拥有90,000个样本。值得注意的是,BatteryLife提供了无与伦比的多样性:4倍的形态、11.8倍的化学体系、1.8倍的工作温度和2.2倍的充放电协议。尤其值得一提的是,BatteryLife是首个发布锌离子(Zn-ion)和钠离子(Na-ion)电池寿命数据集的工作,并额外提供了由电池制造商(即中创新航科技集团股份有限公司)测试的大容量锂离子电池。这种强大的多样性要求模型具备从早期数据到寿命的学习基本映射的能力,并为数据挖掘界和更广泛的电池界提供启发。
在基准方面,BatteryLife提供了统一的实验设置,并支持从1到100个循环的BLP,涵盖了广泛的应用场景。此外,BatteryLife作为一个综合基准,包含了本领域和其他时间序列领域流行的方法。另外,受分块技术[29]和退化测试固有特性的启发,我们提出了CyclePatch——一种用于建模退化测试数据的插件技术。如图1所示,对于相同规格的电池,电压和电流时间序列在协议内的各循环间呈现相似的模式。这一观察促使我们将每个循环视为CyclePatch中的一个令牌(token),显式地捕捉退化测试中的周期性模式。此外,图1表明,来自不同寿命标签电池的循环数据在相同循环次数和跨循环方差方面表现出判别性特征。因此,CyclePatch采用循环内编码器(intra-cycle encoder)来建模每个循环内变量之间的复杂交互。在此框架中,CyclePatch为每个循环生成有信息量的表示,然后应用循环间编码器(inter-cycle encoder)来学习跨循环令牌的有效模式。通过对18种方法的广泛实验,我们揭示了在建模BLP中达到有效预测的一些关键发现。此外,模型在集成CyclePatch后一致获得了性能提升。而且,通过跨老化条件和跨领域的评估,进一步揭示了实现有效BLP的复杂性。
我们的主要贡献总结如下:
- 最大的电池寿命数据集:BatteryLife提供了来自990块电池的90,000个样本,是此前最大数据集的2.5倍。前所未有的数据集规模使研究人员能够在BatteryLife上进行深入研究,产生关于电池寿命数据的实用洞察。
- 最多样化的电池寿命数据集:BatteryLife贡献了最多样化的数据集,在上述所有多样性方面都有显著提升。BatteryLife还首次呈现了包含实验室测试的锂离子、钠离子和锌离子电池以及工业测试的大容量锂离子电池的数据集。BatteryLife无与伦比的多样性要求模型具备学习BLP基本模式的能力。此外,这种多样性使BatteryLife上的进展能够启发数据挖掘社区和更广泛的电池社区。
- BLP的综合基准测试:BatteryLife是一个综合基准,提供了一系列流行基线方法的公平比较。此外,BatteryLife引入了CyclePatch这一面向BLP的插件技术。通过对18个模型的基准测试,我们提供了关于其有效性的有价值见解,揭示了实现准确早期BLP的复杂性。
2 预备知识
2.1 退化测试
传统上,电池寿命通过退化测试来测量,退化测试由重复的循环组成,其中一个循环包括充电和放电阶段。退化测试在温度可控的环境舱中按照预设的充放电协议进行,协议和工作温度根据具体需求设定。在图2中,我们展示了四块电池的部分循环数据。可以观察到,循环数据是时间序列,其中基本信号是电压(V)和电流(I)。需要注意的是,在任意时间步,V或I中的一个由预设协议控制,而未被控制的那个(I或V)可以响应电池的内部状态。容量通过以下公式计算:
$$Q_i = \int_{t_1}^{t_2} |I| \, dt \quad (1)$$
通过这个公式,我们可以计算一个循环中某一时间区域的充电或放电容量。当 $t_1$ 和 $t_2$ 分别为充电或放电阶段的起始和结束时间时,$Q_i$ 即为第 $i$ 个循环的充电或放电容量。电池在第 $i$ 个循环的健康状态(SOH)通过以下公式计算:
$$SOH = \frac{Q_i}{Q_0} \quad (2)$$
其中 $Q_i$ 是第 $i$ 个循环的容量,$Q_0$ 是初始容量。文献[25, 27, 32, 33, 40, 50]通常将放电容量作为 $Q_i$。关于 $Q_0$,一些工作[27, 33, 40, 50]使用额定容量作为 $Q_0$,而另一些[25, 32]将 $Q_1$ 设为 $Q_0$。非线性的SOH退化可能在电池达到寿命终点(80% SOH)之前数百个循环就已发生,如图3所示。
需要注意的是,循环数据模式受老化条件的影响[51]。在本工作中,电池形态、负极、正极、电解质、充电协议、放电协议、工作温度、额定容量和制造商被视为老化因素,任一老化因素的差异将产生不同的老化条件。图2中展示了充放电协议和化学体系影响的生动示例。图2a绘制了一个锂离子电池示例。该锂离子示例具有两段恒流充电(CCC),在不同阶段使用不同电流,然后是充电阶段的恒压充电(CVC)。随后电池进行恒流放电(CCD)和恒压放电(CVD)。然而,其他示例遵循一段CCC,有些没有CVC或CVD阶段。从图2d还可以观察到,工业测试使用的电流是实验室测试(图2a-c)电流的数倍。此外,电池数据模式受底层化学体系的影响,这可以从图2a-c中电压曲线的不同形状中得到印证。
2.2 任务定义
令 $X_{i:N} = [X_i, X_{i+1}, \cdots, X_N] \in \mathbb{R}^{3 \times T}$ 表示从第 $i$ 个循环到第 $N$ 个循环、跨越 $T$ 个时间步的电压、电流和容量变量,其中 $X_i \in \mathbb{R}^{3 \times T_i}$ 是第 $i$ 个循环的循环数据,具有 $T_i$ 个时间步。我们考虑以下问题:给定输入 $X_{1:S}$,其中 $\forall S \leq 100$,$S$ 为正整数,模型需要预测以 $y \in \mathbb{R}^1$ 表示的电池寿命。除非另有说明,我们使用额定容量作为 $Q_0$,根据公式2计算SOH,并将SOH降至不大于80%时的循环次数视为电池寿命,遵循Severson等人[33]的奠基性工作。
3 BatteryLife
3.1 数据集概览
BatteryLife数据集通过整合我们的3个数据集和13个此前可用的数据集[2, 5, 6, 17, 21, 22, 27, 28, 30, 33, 40, 44, 47, 56]构建而成。BatteryLife和以往数据集的数据统计总结在表1中。根据表1,此前的公开数据集仅包含来自实验室测试的锂离子电池。我们通过发布在自己实验室测试的电池提供了锌离子和钠离子电池,并提供了从 CALB 集团获得的大容量工业测试锂离子电池。就此而言,BatteryLife是最大且最多样化的电池寿命数据集。需要注意的是,所有数据集的统计都是在数据预处理后进行的。有关数据预处理的详细信息、每个数据集的简要介绍以及我们3个数据集的退化测试详情,请参阅附录A。为方便使用,我们将所有数据集标准化为pickle文件格式,遵循BatteryML[50]的统一命名规则,而原始数据来自各种命名规则和文件格式。
我们将BatteryLife分为四个部分:Li-ion(13个公开数据集的组合)、Zn-ion、Na-ion和CALB,并在表2中总结了各部分的数据统计。采用这种划分有两个原因。一方面,不同电池类型由于内在的电化学机制而表现出不同的循环模式,因此锂离子、锌离子和钠离子电池被归类为不同部分。同样,CALB电池与其他电池分开,因为它们是电动汽车中使用的大容量电池,受制于工业测试。因此,这种划分按照领域分离了电池数据,可以检验模型在不同领域上的性能。另一方面,这四个部分通常吸引不同的终端用户(电池从业者),因此允许模型进展启发电池社区中的各类用户。
综合而言,BatteryLife提供了标准化的数据,具有前所未有的公开数据集规模和多样性,可用于BLP。这使得研究人员能够探索大量神经网络设计,并通过在BatteryLife上进行研究来产生可操作的洞察。
3.2 流行基准方法
我们在BatteryLife中设置了一系列基准方法。首先,我们选择广泛用于BLP的方法[8, 11, 24, 27, 31, 51],包括Transformer编码器[39]、长短期记忆网络(LSTM)、双向LSTM(BiLSTM)、门控循环单元(GRU)、双向GRU(BiGRU)、卷积神经网络(CNN)和多层感知机(MLP)。在这些模型中,Transformer编码器、LSTM、BiLSTM、GRU和BiGRU直接应用于处理变长输入,然后使用线性投影产生预测。对于CNN,我们使用零将输入填充到相同长度,然后将输入重塑为图像般的矩阵,以电压、电流和容量作为三个通道。具体而言,重塑后的输入维度为(3, 100, 300),其中100是最大输入循环数,300是每个循环内重采样的点数。使用重塑后的输入,二维CNN可以建模循环数据,并基于CNN扁平化输出使用线性投影产生预测。至于MLP,我们利用它来建模维度为(3 × T)的扁平化零填充循环数据,并将其最后一层设为输出层。
此外,考虑到循环数据是多变量时间序列,我们还研究了最初为其他多变量时间序列开发的方法[23, 29, 41, 46, 49]在BLP中的有效性。具体而言,我们进一步纳入了五个基线:DLinear[49]、PatchTST[29]、Autoformer[46]、iTransformer[23]和MICN[41]。流行基准方法的实现细节在附录B.2中描述。一个使用训练标签均值作为预测的虚拟模型也被纳入作为基线。
3.3 CyclePatch
除了第3.2节中提出的流行基线外,我们提出了CyclePatch——一种简单而有效的插件技术,如图4所示。CyclePatch将每个循环视为一个令牌:
$$[X_1, X_2, X_3, \cdots, X_S] = \text{Segment}(X_{1:S}) \quad (3)$$ $$\hat{X}_i = W \cdot \text{flatten}(X_i) + b \quad (4)$$
其中 $W \in \mathbb{R}^{D_1 \times 900}$,$b \in \mathbb{R}^{D_1}$,$\text{flatten}(X_i) \in \mathbb{R}^{900}$。在此框架中,CyclePatch将循环时间序列分割为在退化测试中具有周期性模式的基本单元。由于循环令牌的信息可能因电池内部状态的变化和不同老化条件而有所差异,我们利用循环内编码器来建模每个循环内的信息。具体而言,我们堆叠 $L$ 层前馈神经网络来深度挖掘每个循环令牌内的有效模式。循环内编码器第 $l$ 层的计算如下:
$$\hat{z}_i^l = W_2^l \sigma(W_1^l z_i^{l-1} + b_1^l) + b_2^l \quad (5)$$ $$z_i^l = LN(\hat{z}_i^l + z_i^{l-1}) \quad (6)$$
其中 $W_1^l \in \mathbb{R}^{D_2 \times D_1}$,$W_2^l \in \mathbb{R}^{D_1 \times D_2}$,$b_1^l \in \mathbb{R}^{D_2}$,$b_2^l \in \mathbb{R}^{D_1}$,$LN$ 表示层归一化[3]。$z_i^{l-1}$ 是第 $l$ 层的输入,$z_i^0$ 初始化为 $\hat{X}_i$。经过所有层处理后,每个循环的输出 $z_i^L$ 被拼接:
$$H = \text{Concat}(z_1^L, z_2^L, \cdots, z_S^L) \in \mathbb{R}^{S \times D_1} \quad (7)$$
然后应用循环间编码器提取跨循环令牌嵌入的关键模式:
$$v = f(H) \quad (8)$$ $$\hat{y} = \text{Projection}(v) \quad (9)$$
其中 $f(\cdot)$ 表示循环间编码器。在本工作中,我们探索了使用各种神经网络作为循环间编码器时CyclePatch的有效性,包括MLP、Transformer编码器、LSTM、BiLSTM、GRU和BiGRU。向量 $v$ 同时捕捉了循环内和循环间的信息,线性投影产生最终预测 $\hat{y}$。
4 实验
在本节中,我们报告广泛的实验结果,希望回答以下研究问题:
- RQ1:基准方法在不同领域的表现如何?
- RQ2:CyclePatch框架的主要组件如何影响性能?
- RQ3:基准方法在各领域内应用于不同老化条件时的适应能力如何?
- RQ4:在Li-ion领域预训练的模型对其他领域的可迁移性如何?
4.1 实验设置
原始循环数据在各循环和电池间的步数不同。为确保一致性,对于每个循环,我们使用线性插值将充电和放电数据都重采样到150个点,每个点包含电流、电压和容量记录。因此,每个循环包含300个数据点。当使用前100个循环时,样本中最多有30,000个数据点。在输入模型之前,重采样的循环数据按附录B.2所述进行归一化。
对于BatteryLife中的大多数电池,我们使用测量的寿命终点作为寿命标签。然而,少数电池在循环结束时SOH仍高于80%。虽然一些先前的工作[27, 50]使用最后记录的循环次数作为寿命标签,但这可能引入较大的标签噪声。为减轻这一问题,我们排除了最终SOH大于 $\lambda + 2.5\%$ 的电池。对于SOH在 $(\lambda, \lambda + 2.5\%]$ 范围内的电池,我们应用线性外推来估计 $\lambda$ SOH 时的寿命标签。在本工作中,除CALB外所有数据集 $\lambda = 80\%$,CALB使用 $\lambda = 90\%$,因为大多数收集的CALB电池未达到80% SOH。此外,对于CALB电池,我们按照CALB规定使用 $Q_1$ 作为公式2中的 $Q_0$ 来计算SOH。
我们将BatteryLife按6:2:2的比例随机划分为训练集、验证集和测试集。所有模型使用Adam优化器[19]训练以最小化均方误差。需要注意的是,使用CyclePatch的模型在其名称前加"CP"前缀。例如,CPTransformer使用CyclePatch并以Transformer编码器作为循环间编码器。Transformer在本工作中指Transformer编码器。我们总共进行了超过3,000次超参数搜索(详见附录B.1),并根据验证集选择最佳性能的超参数。为减少实验波动的影响,每个实验运行三次,报告测试集上的均值±标准差。
4.2 评估指标
我们采用两个指标来评估模型性能:平均绝对百分比误差(MAPE)和 $\alpha$-准确率[32]。MAPE被广泛用作BLP的主要评估指标[8, 27, 33, 36, 50],计算如下:
$$MAPE = \frac{1}{N} \sum_i \frac{|y_i - \hat{y}_i|}{y_i} \quad (10)$$
其中 $y_i$ 和 $\hat{y}_i$ 分别是第 $i$ 个样本的真实电池寿命和预测电池寿命。$N$ 是测试集中的样本数。
$\alpha$-准确率从工程角度评估电池领域的模型性能[32, 35],定义为:
$$\alpha\text{-accuracy} = \frac{1}{N} \sum_{i=1}^{N} \mathbf{1}_{|y_i - \hat{y}_i| \leq \alpha y_i} \quad (11)$$
其中 $\mathbf{1}_{|y_i - \hat{y}_i| \leq \alpha y_i}$ 是指示函数,当 $|y_i - \hat{y}_i| \leq \alpha y_i$ 时为1。在本工作中,我们认为预测在相对误差不大于15%时可用,因此使用 $\alpha = 15\%$ 来反映测试数据中可用预测的百分比。15%-准确率在本论文中简称为15%-Acc。
4.3 不同领域的模型性能(RQ1)
在本小节中,我们比较基准方法在不同领域的性能。基准方法被分为四类(MLP、Transformer、CNN和RNN),总体模型性能报告在表3中。观察到MLP和Transformer通常优于其他类别。这一现象与其他时间序列任务中的现代趋势一致[14, 23, 29, 46, 49]。值得注意的是,CyclePatch方法在所有领域均达到最佳性能,验证了所提出的插件技术的有效性。我们还观察到,由于内存限制或训练速度慢,原始Transformer和RNN不适合处理具有30,000个点的BLP。相比之下,CyclePatch使这些模型变得可行,提升了内存效率和训练速度。此外,Li-ion、Zn-ion、Na-ion和CALB数据集上的最佳MAPE分别为0.179、0.515、0.255和0.141。Zn-ion数据集上的较差性能可归因于在每个化学系统有限数据的情况下学习多样化化学系统的挑战。
对于其他时间序列数据流行的方法[23, 29, 41, 46, 49],它们在BLP中通常表现不佳。可能的原因有两方面。一方面,用于分解趋势和季节模式的显式架构设计不适合BLP。这主要由以下证据支持:具有趋势和季节分解的模型(DLinear、Autoformer和MICN)在大多数数据集上表现不佳。MLP通常明显优于DLinear这一结果进一步印证了这一点,而MLP实际上移除了DLinear中的分解设计。趋势和季节分解的失败是合理的,因为与寿命相关的信息存在于变量(电压、电流和容量)之间的细粒度交互中,而非趋势和季节中,如图1所示。此外,由于循环数据具有规律的周期(循环),学习这些周期变得冗余。
另一方面,某些技术对电池循环数据来说不是最优的。特别地,如表3和表4所示,没有循环内编码器的CPTransformer仍然持续优于PatchTST,而去掉循环内编码器的CPTransformer是PatchTST不带RevIN[18]的特例。这表明RevIN(在时间序列模型中广泛采用[29, 42, 43, 45])破坏了变量之间固有的交互。对于iTransformer[23],它将一个变量的时间序列嵌入为变量令牌然后建模变量令牌间的交互,导致在不同时间区域的细粒度交互信息丢失。此外,虽然分块技术在时间序列任务中被广泛使用,但现有方法通常使用简单的线性层来生成令牌嵌入。相比之下,CyclePatch操作循环令牌并在应用循环间编码器之前应用循环内编码器来捕捉循环内交互,保留了循环数据的内在特性。这些发现表明,在其他时间序列领域成功的技术不能简单地应用于BLP。
我们还研究了前三名模型随可用循环数增加在不同领域的性能,结果如图5所示。模型性能最初随可用循环数增加而提升,然后趋于平台期。这表明虽然更多循环提供了额外信息,但当循环数超过某个阈值后,信息增益递减。此外,我们注意到Zn-ion和CALB数据集上的最佳基准方法在某些循环数下可能不是最佳性能。这些发现表明,开发能够有效处理各种循环数循环数据的模型是一个有前景的研究方向。
4.4 消融研究(RQ2)
我们对所提出的CyclePatch进行消融研究,以研究其关键组件的有效性,结果在表4中展示。具体而言,我们研究CPMLP和CPTransformer,考虑它们在各数据集上的领先性能。"w/o Intra"指移除循环内编码器;"w/o Inter"指移除循环间编码器;MLP和Transformer作为没有分块的原始基线。从表4可以看出,CyclePatch的所有组件都显著贡献了其性能。具体而言,循环内编码器的整合增强了模型建模循环内变量间交互的能力,在所有数据集上带来性能提升。移除循环间编码器会降低性能,突显了建模循环间交互的重要性。此外,观察到去掉循环内编码器或循环间编码器的CPMLP在Na-ion和CALB数据集上的表现比MLP更差,而MLP天然地建模了循环内和循环间信息。这表明建模循环内和循环间信息都是至关重要的。这些结果共同验证了CyclePatch设计的有效性。
4.5 模型在已见和未见老化条件下的性能(RQ3)
我们进一步研究前三名模型在训练集中已见和未见老化条件下的泛化能力,结果在表5中展示。这至关重要,因为广泛的BLP应用要求模型在不同老化条件下保持有效。结果表明,模型在未见老化条件下的表现通常比已见条件差。这种差异由老化条件间不同的数据分布导致的领域偏移所致,如第2.1节所讨论。此外,我们注意到在已见或未见老化条件中表现优异的模型在整体性能上可能不是最佳模型。这表明BatteryLife要求模型能够同时处理独立同分布和分布外的情况。
4.6 跨领域可迁移性(RQ4)
在实际情况中,新类型电池通常少于旧类型电池,因此开发具有跨领域可迁移性的模型以应对由电池类型引起的领域偏移非常重要。在本工作中,我们通过调查在Li-ion数据集上预训练的模型是否能迁移到其他领域来评估跨领域可迁移性,结果报告在表6中。具体而言,我们研究CPMLP(Li-ion领域最佳模型)的可迁移性。考虑三种可迁移性评估:(1) Frozen:直接在目标领域应用预训练的CPMLP。(2) Fine-tuning (FT):微调预训练CPMLP的所有参数。(3) Domain adaptation (DA):通过最小化目标领域和源领域最后隐藏层产生的嵌入之间的最大均值差异[9]来实施领域适应技术。按预期,通过迁移学习技术,一个有效的可迁移模型应该优于仅使用目标领域训练数据训练的最佳基线。
表6显示,由于显著的领域偏移,冻结的预训练模型在目标领域表现很差。虽然微调和领域适应相比冻结模型有所改善,但在大多数情况下仍不如基线。这表明从多样化的实验室测试数据(具有数百种老化条件)中提取相关信息到其他电池类型仍然具有挑战性。跨领域评估结果表明,BatteryLife在跨领域可迁移性方面仍有很大改进空间。
5 结论与未来工作
在本论文中,我们提出了BatteryLife,通过整合16个数据集创建了最大且最多样化的电池寿命数据集。前所未有的数据集规模和多样性使BatteryLife上的进展能够为广泛的电池和数据挖掘社区产生可操作的洞察。此外,BatteryLife提供了一个综合基准,包括在本领域和其他时间序列领域流行的基线方法。大量实验表明,BatteryLife包含开发BLP专用时间序列模型的研究机会。在未来研究中,我们还将关注本文中发现的研究领域,并计划将更多数据集纳入BatteryLife。
6 致谢
作者感谢国家重点研发计划(No. 2023YFB2503600)的财政支持。本工作还得到了国家自然科学基金(No. 52207230, No. 92372109 和 No. 62206067)、广州市-香港科技大学(广州)联合资助项目(No. 2023A03J0003, No. 2023A03J0103 和 No. 2023A03J0673)以及广州市科技项目(No. 2024A04J4216)的研究资助。
附录 A 数据集进一步详情
A.1 数据预处理
在本节中,我们介绍所有数据集的预处理详情。我们从BatteryArchive获取了HNEI、MICH、MICH_EXP、SNL和UL_PUR数据集。其他数据集来自原始论文分享的链接。对于所有数据集,本研究过滤掉SOH未降至 $\lambda + 2.5\%$(CALB数据集 $\lambda = 90\%$,其他数据集 $\lambda = 80\%$)以下的电池,然后进行数据统计。需要注意的是:(1) BatteryArchive是一个活跃的网站,本文中的数据统计基于2024年9月之前的可用数据。(2) Stanford[5]多次发布,本工作使用第一次发布的数据。对于BatteryLife,我们进一步排除了寿命标签不大于100的电池。此外,我们发现UL_PUR数据集中的某些电池包含不可恢复的突然显著SOH下降。我们推测这些下降是由设备故障引起的,因此移除了这些电池。
对于BatteryML[50]标准化的7个数据集,我们按照BatteryML[50]的方法在放电容量退化轨迹上运行中值滤波器检测异常循环并移除检测到的异常值。对于其他数据集,我们首先移除了性能测试(RPT)循环和化成循环。移除RPT循环是因为它们遵循与循环协议不同的充放电协议,且RPT循环通常也被BatteryML[50]检测为异常值。同样,化成循环也被移除。此外,一些放电容量突然上升或下降的循环被手动移除。数据清洗后,每块电池以与BatteryML[50]一致的数据格式存储。
A.2 退化测试详情
锌离子电池的数据使用实验室自制的扣式电池收集。扣式电池使用广东烛光新能源科技有限公司的不锈钢CR2032、CR2025和CR2016电池壳,配以高度为0.6mm的不锈钢弹簧垫片和0.5mm厚度的不锈钢垫片,在75 kg/cm²的压力下密封。锌电池的正极材料为从广东烛光新能源科技有限公司购买的商用二氧化锰正极。负极材料为由当地制造商生产的99.99%纯锌箔。隔膜为Glass Fiber-D。电解液为2 mol/L硫酸锌和0.1 mol/L硫酸锰的水溶液,并添加不同类型和浓度的添加剂。电池测试在400 mA/m²的电流密度下进行,分别在25°C、30°C和40°C下评估。
实验中使用的高倍率钠离子18650圆柱电池来自珠海普纳什代新能源有限公司,无需额外处理。电极材料和电解质的具体组成仍为制造商的专有信息。额定容量通过1C倍率的充放电循环确定。所有循环测试在2.0V至4.0V的电压范围内进行充放电。为评估长期性能,在25°C下以从2C到6C的12种不同电流倍率进行循环测试。
CALB数据集中的锂离子电池数据由 CALB 集团提供。测试前,所有电池放置至热平衡。然后应用两种不同的协议: a) 对于在0°C测试的电池,以1C恒流放电至2.2V,静置10分钟后,以1C恒流充电至4.35V,再以4.35V恒压充电至电流低于0.05C,再静置10分钟。这构成加速退化测试,超出了这些电池的设计规格。 b) 对于在25°C、35°C和45°C测试的电池,经历9个不同的充电阶段(多段恒流恒压充电策略)。
A.3 集成数据集概述
各集成数据集简要介绍如下:
- CALCE [10, 47]:13块棱柱形锂离子电池,正极为LiCoO₂,负极为石墨,额定容量1.1 Ah或1.35 Ah,工作温度25°C,2种协议。
- HNEI [6]:14块18650锂离子电池(LG Chem),正极为LiCoO₂和LiNi₀.₄Co₀.₄Mn₀.₂O₂混合,额定容量2.8 Ah,25°C,2种协议。
- MATR [2, 33]:169块18650圆柱电池,正极为LiFePO₄,负极为石墨,额定容量1.1 Ah,30°C,81种快速充电协议。
- UL_PUR [17]:10块18650圆柱电池,正极为LiNi₀.₈Co₀.₁₅Al₀.₀₅O₂,额定容量3.4 Ah,23°C,相同循环协议。
- SNL [30]:50块18650圆柱电池,正极涵盖LiFePO₄、LiNi₀.₈₁Co₀.₁₄Al₀.₀₅O₂和LiNi₀.₈₄Mn₀.₀₆Co₀.₁O₂,3种额定容量,3种工作温度,23种协议。
- RWTH [22]:48块18650圆柱电池,正极为NMC,负极为碳,额定容量3 Ah,25°C。
- MICH_EXP [28]:18块软包电池,正极为NCM111,额定容量5.0 Ah,3种工作温度(-5°C、25°C、45°C),6种协议。
- MICH [44]:40块软包电池,正极为NCM111,额定容量2.36 Ah,2种工作温度(25°C、45°C),2种协议。
- HUST [27]:77块18650圆柱电池,正极为LiFePO₄,额定容量1.1 Ah,77种多段放电协议,30°C。
- Tongji [56]:108块18650圆柱电池,3种化学体系,2种额定容量(3.5 Ah和2.5 Ah),3种工作温度,6种协议。
- BatteryArchive [1]:139块电池,3种形态,8种化学体系,6种工作温度,36种协议,2024年。
- Stanford [5]:41块软包电池,正极为LiNi₀.₅Mn₀.₃Co₀.₂O₂,额定容量0.24 Ah,不同化成协议,30°C。
- XJTU [40]:23块18650圆柱电池,正极为LiNi₀.₅Co₀.₂Mn₀.₃O₂,额定容量2 Ah,20°C,2种操作条件。
- ISU_ILCC [21]:240块502030尺寸锂聚合物电池,正极为镍锰钴氧化物,额定容量0.25 Ah,202种协议,30°C。
- Zn-ion:100块锌离子扣式电池,正极为MnO₂,负极为锌金属,3种工作温度。
- Na-ion:31块钠离子18650圆柱电池,额定容量1.0 Ah,12种协议,25°C。
- CALB:27块棱柱形电池,正极为NMC,额定容量58 Ah,2种协议,4种工作温度(0°C、25°C、35°C、45°C),工业测试。
附录 B 实验进一步详情
B.1 超参数进一步详情
对于每个模型,我们尝试了超过20组不同的超参数,并选择在验证集上MAPE最低的超参数。超参数搜索范围如下:batch size从[16, 32, 64, 128]中选择,学习率从[5×10⁻⁴, 5×10⁻³, 1×10⁻³]中选择,dropout率从[0, 0.05, 0.1]中选择,嵌入维度从[32, 64, 128, 256]中选择。此外,对于CyclePatch模型,循环内编码器层数和循环间编码器层数均从0到12调整。CNN层数从1到8调整。
B.2 基线实现详情
首先,循环数据根据第4.1节的过程被重采样为 $X \in \mathbb{R}^{3 \times 30000}$。之后,每个循环中的三个变量按以下方式归一化:
$$p_i = p_i / Q_{nominal} \quad (12)$$ $$v_i = v_i / max(v_i) \quad (13)$$ $$s_i = s_i / Q_{nominal} \quad (14)$$
其中 $p_i \in \mathbb{R}^{300}$、$v_i \in \mathbb{R}^{300}$、$s_i \in \mathbb{R}^{300}$ 分别表示第 $i$ 个循环的容量、电压和电流记录。$Q_{nominal}$ 表示额定容量。
Transformer编码器、LSTM、BiLSTM、GRU、BiGRU可以直接建模循环数据并产生预测。MLP首先使用线性层嵌入输入,然后使用堆叠的全连接神经网络建模。CNN将输入重塑为(3, 100, 300)的形状,使用Conv2d、ReLU激活和平均池化提取特征。对于DLinear、PatchTST、Autoformer、iTransformer和MICN,我们使用 https://github.com/thuml/Time-Series-Library 的实现,略微修改分类实现以使模型可用于BLP。
译者注:本翻译基于 arXiv:2502.18807v7 (2025年11月12日版本) 的全文进行翻译。原文共13页,发表于 KDD '25。所有公式、表格和图引用均保留原文编号。参考文献列表(56条)因篇幅原因未全部翻译,可在原文中查阅。