楼主是大师呀。因为PLS只在少数MBB培训课程里简要提到的。
要真正学会PLS,不能直接从MINITAB入手,应该了解PLS的原理。懂得PLS的原理,操作就很简单。但三言两语怕是讲不清。试试吧,但你可能仍需自己找资料看才能搞明白。
PLS是1983年由S.Wold 和C.Albano等人首先提出的,是比较新的统计技术,被称为第二代回归分析方法。PLS的三个特点:1)多因变量对多自变量建模;2)能较好地解决许多OLS无法解决的问题,如自变量的多重相关性;3)实现多种数据分析方法的综合应用。从原理上讲,基本上PLS等于多元现行回归分析+典型相关分析+主成份分析。特别适用于试验数据点子少而变量个数多或变量间高度相关的情形。PLS对参数的估计是有偏的,但其估计的方差往往最小。PLS的基本思路是:首先对原始变量的数据做标准化处理,再分别从自变量数据和因变量数据中各提取一个组份(Components)(实际上是中间变量,是远来变量的线性组合),这些组份应能最大限度地代表原始数据的信息,但方法与主成份分析迥然不同。它是在保留最大信息的同时令新的变量之间的相关性最大(通过令协方差最大来实现)来求得。每提取一次,就要用两组标准化变量分别对中间变量做线性回归,并计算残差。然后用残差代替刚才的变量,重复上面的步骤,继续提取组分和作回归,叠代反复,直到再没有可提取为止。如果总共提取了m个组份,那么就用标准化的因变量对这m个组分作多元线性回归,最后再表示成原始变量间的回归方程。具体算法很繁琐,你可以找文章自己看。下面简述MINITAB的操作。MINTAB14首次具备这个功能。
1.如果要求形如楼主所列的二次模型,应先对数据做标准化处理:Calc>Standardize.如果只求一次模型,则不必。MINITAB会自动完成。
2.按楼上一位讲的菜单进入PLS对话窗。最上两个大框就不表。要提醒的是,只有当因变量间高度相关时,因变量才一起选入(这可以通过专业知识和求相关矩阵来鉴别)。下面的最小的一个框里填的数字不要超过自变量个数。另外,模型中的每一项做一个变量。
3.点Validation…子对话窗,可选Leave-one-out.意为每次删去一个后建模,然后把删掉的那个观察值代入模型,计算预测统计量(PRESS)。这就是交叉验证。如果数据较多则可以选下面两项。
4.其余的三个子窗,不影响计算结果。可根据需要选。为了还原成标准化前的原始变量间的关系模型,应将系数和标准化系数存下备用。
5.文本窗里首先告诉你交叉验证的结果。提取多少个组份是最佳的。遗憾的是,无法更改。这还可以通过下面的R-Sq(pred)(一般选最大)和Model selection plot(垂直线对应的数目为最佳)来看。
6.从Std coefficient plot可以观察各变量项对响应的贡献幅度和正负性。可以代表效应大小。实际应用的时候,对柱子特短的是可以略去的。
7.另一个很重要的图是residual versus leverage plot。可以通过它进行异常值和杠杆点判别。
8.按标准化计算公式 标准化值=(原始值-平均值)/ 样本标准差 代入标准化变量的回归方程就可得到原始变量间的回归方程。
2006-04-06 00:14