于模型子集选择时,这些准则与解释输出变量的回归因子意义无关,即没有考虑最终模型的逼近能力。
2.2.3 基于相关函数的模型验证
模型验证测试是为了检测模型的不充分性。如果模型结构和模型参数估计适当,来源于过去输入u(t)和输出y(t)的所有线性和非线性组合的残差序列?(t)?y(t)??mi?1?i(x(t)??i,应该是不可预报的。尽管设计基
[4]
于相关函数的模型验证测试复杂和困难,也有不同的基于相关性模型验证测试方法以解决系统非线性。
3. 采用逐步选择算法的模型构建
非线性建模的原理实际上就是找到一个泛化性最好的最小模型。工程应用中需要稀疏模型,因为模型计算的复杂性与模型的复杂性成正比。并且从知识提取的角度来说,稀疏模型较容易解释。认识到非线性系统辨识是一个难处理的优化问题是非常重要的,因为任何算法仅仅是针对一定假设条件下问题的求解。在实际应用中,迫切需要计算简约的优化算法。
在任何实际非线性系统辨识算法中,最初将这些问题形式上看做一些易处理的问题,获取次优解。
从m个候选项中选择n?个子集,假设m?500,n??40,可能的模型结构m!?n?!(m?n?)!??2.2443?1059。前向/后向子集选择算法是一种贪婪算法,目的是在每个回归阶段优
n?化某个目标函数。经典的前向(后向)方法一次添加(去掉)一个模型回归因子。选择对模型适配度ERR最大贡献或(或最小恶化)的回归因子。前向算法候选模型计算降为?k?0(m?k)?n?m?2?104。
在各种逐步子集选择算法中,前向正交最小二乘(OLS)是一种高效的非线性系统辨识算法,OLS 根据最大模型误差减小比以前向的方式选择回归因子。
前向OLS估计器采用前向回归估计的方式,从m个回归因子中选择一组n?个变量
?k?[?k(1),??kN(T)]k,??1n,pk,k?1,?n?。为了得到好的泛化性,通常将?组成一组正交基
模型选择准则(如AIC)与OLS结合,确定模型结构。OLS算法成为一种流行的神经网络建模工具,如模糊/神经模糊系统,并在工程领域广泛应用。
3.1 局部正则正交最小二算法LROLS( locally regularised orthogonal least squares algorithm)
正则技术与前向OLS结合的正则正交最小二乘ROLS的优势在于在正交空间用于辅助参数正则化,减少参数估计方差,大大简化参数估计的计算量。另外,Chen(2002)提出了局部LROLS,自动选择一组n?个回归因子构建简约模型[5]。
LROLS用于模型选择一个可能缺点是模型泛化性不是直接优化求解。AIC或其他基于信息的准则通常采用简化的测度作为逼近公式,对模型复杂度特别敏感。除了影响模型选择终点,LROLS(公式24)对模型泛化性比模型选择准则(AIC/PRESS/FPE/Cp)判别能力更强。这意味着回归因子可能引起模型性能恶化,例如参数方差太大或回归矩阵病态,在模型选择期间,回归因子不会直接处于不利地位。
J(k)(k?1)?J?1Ng2kkk (24)
2
3.2 前向选择中模型选择准则的改进
基于实验设计标准,通过修改模型选择准则,最近出现了很多OLS算法变体,确保根据试验设计标准在候选模型中找到最好模型。OLS算法变体包括A-优化、D-优化、LOO误差均方根优化、被也是正则优化等,其中A-优化和D-优化算法模型选择准则如下:
A?optimality?OLS:J(k)?J(k?1)?1N1Ng2kkk?22?Akk?1?log???kk? (25)
D?optimality?OLS:J(k)?J(k?1)?g2kkk??D在每个前向迭代步骤中,?A和?D是小正定数,在模型逼近能力和最优设计准则之间进行折中调节。公式(25)中第(3)项基于模型表示的正交试验设计标准的结果。?A和?D由用户设定,大范围的?A和?D能够改进模型鲁棒性。?A和?D还可以采用另一数据集合的交叉验证经验设定。额外参数影响建模性能,保持额外调整参数最小是有利的。
3.3其它逐步选择算法
(1)基于M-估计的正交模型选择算法,建立M估计器处理观测数据中的离群点,用于鲁棒模型辨识。 (2)向后逐步选择(backward stepwise selection)
向后删除方法一次去掉一个模型适配中最小恶化的回归因子。当候选模型维数小时,向后删除方法计算成本大幅度降低,因此,向后删除方法作为事后处理步骤,由于计算上的可行优势,用于混合建模,修剪其他方法辨识的模型。Hong(2007)使用模型适配度和A-优化、D-优化、LOO误差之间的混合成本函数,改进传统后向选择方法[6]。 (3)模型结构选择和参数优化的混杂算法
进一步降低计算复杂度,改善可调参数神经模型紧密度,提出了一种同时选择模型结构和参数优化的混杂算法。正交前向选择算法设计采用一个可调的对角协方差矩阵,而不是固定的普通方差,和一个可调RBF中心代替输入训练数据集合约束的RBF中心。在这些方法中,在集成分析框架下实行网络生长和参数优化 ,大大增加了最小核模型的建模性能。
4. 采用凸优化算法的模型构建
尽管在实际数据建模中,分步子集选择算法(stepwise subset selection algorithm)应用广泛和高效,但致命的弱点是只能得到次优解,最终的模型不是最优的。随着不断增长的廉价计算资源,不是很贪婪的非线性建模方法引起广泛关注,比如基于凸优化的算法。在机器学习领域,最近的研究热点之一是支持向量机SVM,一种易处理的基于结构风险最小化原理的分类和回归算法SVR。
在机器学习中,模型的泛化性用于描述机器学习能力。由于SVR模型公式
N*?j)k(x,?a(x(j))b中,仅仅?(j)??(j)?的非零数据点x(i) 包含在SVR模型内,??f(x)?????j?1(j?)*所以SVR模型具有稀疏属性。这些数据点被认为是支持向量SV(support vectors),满足
N*y(i)????(j)?a(j)???k(x,x(j))?b??。通过合理设定?值,可控制支持向量SV个数,最终模型含
j?1有SV个数较少。
SVM训练是一个保证全局优化的凸QP求解问题。然而,标准QP问题对大规模数据集的求解效率低,解决办法之一是分块(chunking),在一个工作集合上操作,训练数据集合维数固定,便于找到工作集合支持向量SV。重复(iterate)这个过程,并且在每一次迭代过程中,选择一组违背当前估计器最优条件的最差输入数据作为下一步迭代的工作集合。为了获取最大计算效率, Smola and Schlkopf(1998)[7]和Platt(1999)
[8]
提出了序列最小优化SMO(sequential minimal optimisation)。SMO将大型QP问题分为一系列最小可能二维的QP问题,这样,可求得分析解,而不是耗时的数值QP解题器作为内环。一种改进的SMO-SVR进一步改善Smola的 SMO-SVR模型性能。
尽管SVR采用?不敏感损失函数,SVR具有稀疏性控制属性,但最终的SVR模型可能还是规模大。当前的研究热点集中在改善SVM的稀疏性。经验研究表明,OLS与SVR相比趋向小模型,然而在低信噪比情况下对噪声鲁棒性差。Lee and Billings (2002)[9]提出了SVM-OLS方法,用于减少模型尺寸,最终模型抑制噪声。
非线性系统辨识中最小二乘支持向量机LSSVM是一种非常有吸引力的方法。这部分是因为最初的LSSVM不是采用QP求解,而是一种简单得多的常规最小二乘算法。但是,LSSVM模型缺少稀疏性,该缺点可能通过将研究空间限制在数据集合子集范围内回避。另外还可以采用递阶建模策略,使用QP解题器获取模型有利的稀疏性表示。
5 输入选择算法(Input selection algorithms)
对于先验未知的非线性系统辨识是在有限数据集合学习最小模型表示(minimal model representation)。任何模型结构确定包括合适因果输入变量(appropriate causal input variables)选择和候选基函数集合. 对于实际系统的输出,当模型中存在某些其他输入变量,一些输入变量可能是冗余的或没有意义。过参数化(overparametrisation)对系统动态行为的影响采用定性分析方法从经验上研究过了,发现输入滞后(lag)过参数化严重影响。选择最小数目的相关输入作为预处理步骤可改善建模性能。
难点:因为系统输入输出关系呈非线性且输入变量通常不独立,最优输入选择非常棘手。影响模型性能因素和数据非常多,如何从大量的影响因素中选择出对期望输出影响较大的一些因素,组成一个有效输入变量集,成为系统辨识方法首先面对的问题。主要的输入选择算法包括: (1) 互信息MI( Mutual information)
MI量化了两个随机变量之间的依赖程度,理论上适合作为输入选择的测度。两个随机变量之间互信息越大,意味它们之间关系越密切;相反,如果互信息为零,意味着这两个随机变量完全不相关,或称相互独立。与相关系数相比,互信息能兼顾变量间的线性和非线性。MI是一种贪婪算法,根据一次一考虑候选输入变量、输出变量和上一步所选变量集合之间的互信息来选择输入变量。基于互信息方法的缺点是需要估计概率密度且估计所需数据量要求高。
基于互信息变量选择的子空间回归,互信息量小于一个特定阈值的变量被淘汰,每个成员模型在原始变量的一个子空间得到训练。由于互信息量小于一个特定阈值的变量被淘汰,每个成员模型在原变量集的一个子空间训练,因此可避免多元共线性带来的诸多问题。 (2) 删除算法
一些简单的删除算法,如基于聚类算法、基于函数属性的规则方法,可以消除冗余输入[10]。 (3) 分段局部线性模型输入选择方法(piecewise local linear model-based input selection approach)
基于分段局部线性模型输入选择方法(Mao and Billings 1999) 采用泰勒技术展开,如果观测向量x(t)落在x(t0)小邻域内,输入输出关系由f(·)一阶导数主导,然后假设忽略高阶项,得到适合的局部线性模型。分段局部线性模型输入选择算法把输入空间划分为子区域,子区域数据集DN划分为不同组。对于每一个子区域,使用线性模型形式,OLS算法用于选择输入变量的子集。所选输入变量的合并为最终模型结构中输入变量。文献(Hong and Harris 2001b) 将分段局部线性建模与OLS算法集成,提出了完全自动分段局部线性模型输入选择算法。
(4) 方差分析ANOVA (analysis of variance)
方差分析是在可比较的数组中,把数据间的总的―变差‖按各指定的变差来源进行分解的一种技术。对变差的度量,采用离差平方和。方差分析方法就是从总离差平方和分解出可追溯到指定来源的部分离差平方和,这是一个很重要的思想。一种同时降低输入变量和基函数方法是方差分析ANOVA扩展方法
[11]
nnnf(X)?f0??i?1fi(xi)???i?1j?i?1fi,j(xi,xj)?e(x)
其中所有的fi和fi,j是基于输入向量子向量的基函数线性参数模型。因为正交选择算法选择最有意义项组成一个简约模型,最终模型中仅仅包含有意义的变量,去掉了许多项。
6 在线辨识算法(On-line system identification algorithms)
离线建模算法在模型训练过程中使用全部数据集。迭代参数估计算法,如迭代最小二乘(RLS)和预报误差算法,直接适用于参数线性化模型。使用离线算法建模,模型数据类似估计数据集,模型结构固定,使用线性递归算法进行参数更新。若新数据特性明显不同于估计数据,保留模型。在线系统辨识算法是非常重要的一类建模算法,处理模型结构和新数据样本到来时更新模型参数。假设使用采集到(t?1)时刻数据样本,辨识模型。已知t时刻数据样本和(t?1)时刻先验模型,在线模型辨识算法提出如何通过加入新数据样本产生的新息更新模型的问题。在线辨识算法优势在于新数据到来时模型更新,而不是重头开始重学。
在线非线性系统辨识算法的重要特征是具有改变模型结构适应数据样本的能力。在线辨识算法从最初的高斯RBF网络发展起来的资源分配网络(RAN)、扩展卡尔曼滤波器RAN(RANEKF)、将删除算法与RAN-EKF方法结合的最小资源分配网络(MRAN),发展到生长-剪枝GAP-RBF网络(growing and pruning RBF)。该类方法在网络开始时没有隐层单元。在学习过程中,将根据下列―新颖性‖条件来确定是否将某个输入增加为新的隐层单元。GAP-RBF算法在生长和剪枝策略中引入神经元―权‖的概念。在训练中,发现某个神经元的―权‖比学习精度小,这个神经元将被去掉,且只需要检查与最新输入数据距离最近的神经元的―权‖。如果新的输入数据并不需要增加新的神经元,那么只有距离最近的那个神经元的参数被调整。这样,计算量将减少,学习的速度也提高了。GAP-RBF算法目的是实现较高的计算效率,这对于在线算法是一个关键的要求。
对任何在线辨识方法,由于时间约束,很难完成最优模型结构选择任务。实际上,在不同线性化算法确定生长-剪枝策略中,用户根据建模精度定义不同阈值。用于快速计算的逼近公式通常用于加快计算速度。基于RKHS理论的生长-剪枝策略和模型泛化性之间的连接没有很好的研究,除增量映射学习IPL(incremental projection learning)和核RLS少数例外。核RLS模型本质上是一种生长核模型,为提高计算效率,建立了在线稀疏方法。核算法计算复杂性与核基的稀疏性成正比。因为在线稀疏性有助于减少计算成本,核算法对线性应用的普遍适用性,严重依赖于核空间解的稀疏性。
7 结论
工业界广为接受,仅仅利用数据就可建立基本过程最简约模型的参数线性化系统辨识方法。对静态、随机过程,在现有批数据情况下,核方法和相关算法相对成熟,如SVM。
未来研究问题:
(1) 目前一个崭新的和开放的研究领域是同时辨识模型结构和参数的在线迭代算法。
(2) 未知非平稳或时变非线性过程辨识也是非常重要领域,但目前不完全开放的原因是该问题非常棘
手。
[1] Ljung, L., and Vicino, A. (2005), Special Issue on Identification, IEEE Transactions on Automatic Control,
50(10), 1477–1634. [2] uano, A.E. (2005), Intelligent Control Systems using Computational Intelligence Techniques, London: IEE Publishing.
[3] Espinoza, M., Suykens, J.A.K., and De Moor, B. (2005b), Kernel Based Partially Linear Models and
Nonlinear
Identification, IEEE Transactions on Automatic Control, 50(10), 1602–1606.
[4] Zhang, L.F., Zhu, Q.M., and Longden, A. (2007), A Set of Novel Correlation Tests for Nonlinear System
Variables, International Journal of Systems Science, 38(1), 47–60.
[5] Chen, S. (2002), Locally Regularised Orthogonal Least Squares Algorithm for the Construction of Sparse
Kernel Regression Models, Proceedings of 6th Int. Cof. Signal Processing, China: Beijing, pp. 1229–1232. [6] Hong, X., and Mitchell, R.J. (2007), Backward Elimination Model Construction for Regression and
classification using Leave one Out Criteria, International Journal of Systems Science, 38(2), 101–113. [7] Smola, A.J. (1998), Learning with Kernels. Ph.D. thesis, Germany: Informatik der Technischen Universitate Berlin.
[8] Platt, J. (1999), Fast Training of Support Vector Machines using Sequential Minimal Optimization, in
Advances in Kernel Methods – Support Vector Learning, eds. C.J.C. Burges, B. Scho¨ lkopf, and A.J. Smola, Cambridge, MA: MIT Press, pp. 185–208.
[9] Lee, K.L., and Billings, S.A. (2002), Time Series Prediction using Support Vector Machines, the Orthogonal,
and the Regularised Orthogonal Least Squares Algorithms,’’ International Journal of Systems Science, 33, 811–821.
[10] Sindelá?, R., and Babu?ka, R. (2004), ―Input Selection for Nonlinear Regression Models, IEEE Transactions
on Fuzzy Systems, 12(5), 688–696. [11] Bossley, K.M. (1997), Neurofuzzy Modelling Approaches in System Identification, Ph.D. thesis, University
of Southampton, Dept. of ECS.