信度和效度

信度与效度可以简单概括为“两斤白糖“,两斤是信度,白糖是效度。如果测出来的是一斤半或者是两厘米,那就说明信度有问题。如果测出来的是盐巴或者大米,不是我们想要的白糖,那就是效度问题。

信度

信度(Reliability)即可靠性,它是指采用同样的方法对同一对象重复测量时所得结果的一致性程度。信度指标多以相关系数表示,大致可分为三类:稳定系数(跨时间的一致性),等值系数(跨形式的一致性)和内在一致性系数(跨项目的一致性)。信度分析的方法主要有以下三种:重测信度法、分半信度法、α信度系数法。

重测信度是用同样的问卷对同一组被调查者间隔一定时间重复施测,计算两次施测结果的相关系数。同一个测试或测量工具在不同时间测量结果的一致性程度。如果一个秤,今天称一袋东西重两斤,但是明天称就成了一斤半,那说明信度不高。

显然,重测信度属于稳定系数。重测信度法特别适用于事实式问卷,如性别、出生年月等在两次施测中不应有任何差异,大多数被调查者的兴趣、爱好、习惯等在短时间内也不会有十分明显的变化。如果没有突发事件导致被调查者的态度、意见突变,这种方法也适用于态度、意见式问卷。由于重测信度法需要对同一样本试测两次,被调查者容易受到各种事件、活动和他人的影响,而且间隔时间长短也有一定限制,因此在实施中有一定困难。

分半信度是将调查项目分为两半,计算两半得分的相关系数,进而估计整个量表的信度。折半信度属于内在一致性系数,测量的是两半题项得分间的一致性。这种方法一般不适用于事实式问卷(如年龄与性别无法相比),常用于态度、意见式问卷的信度分析。在问卷调查中,态度测量最常见的形式是5级李克特(Likert)量表。进行折半信度分析时,如果量表中含有反意题项,应先将反意题项的得分作逆向处理,以保证各题项得分方向的一致性,然后将全部题项按奇偶或前后分为尽可能相等的两半,计算二者的相关系数(即半个量表的信度系数),最后用斯皮尔曼-布朗(Spearman-Brown)公式求出整个量表的信度系数。

内部一致性α系数是同质性信度,也叫Cronbach α信度系数,是最常用的信度系数,α系数评价的是量表中各题项得分间的一致性,属于内在一致性系数。这种方法适用于态度、意见式问卷(量表)、个性量表的信度分析。总量表的信度系数最好在0.8以上,0.7-0.8之间可以接受;分量表的信度系数最好在0.7以上,0.6-0.7还可以接受。Cronbach 's alpha系数如果在0.6以下就要考虑重新编问卷。内部一致性信度主要反映的是测验内部题目之间的信度关系,考察测验的各个题目是否测量了相同的内容或特质。

内部一致性估计是有用的信度量数,因为它只测量一次,因此可以排除记忆和练习的效果。然而,也存在一定的问题:它只可在测量单一特质的测验上使用。例如,它可用于拼音测验,但不能用在包含拼音、阅读理解和作文等部分的语文测验。第二,当应用在速度测验上时,内部一致性量数会有信度估计膨胀的现象。因为速度测验都是简单或相对简单的题目,并且要在限制时间内完成。在这样的测验中,受测者应该可以答对他所作答的大多数题目,因此内部一致性都会很高。

效度

效度是测量的有效性程度,即测量工具确能测出其所要测量特质的程度,或者简单地说是指一个测验的准确性、有用性。效度是科学的测量工具所必须具备的最重要的条件。在社会测量中,对作为测量工具的问卷或量表的效度要求较高。鉴别效度须明确测量的目的与范围,考虑所要测量的内容并分析其性质与特征,检查测量的内容是否与测量的目的相符,进而判断测量结果是否反映了所要测量的特质的程度。

效度具有相对性,任何测验的效度是对一定的目标来说的,或者说测验只有用于与测验目标一致的目的和场合才会有效。所以在评价测验的效度时,必须考虑效度测验的目的与功能。

效度具有连续性,测验效度通常用相关系数表示,它只有程度上的不同,而没有“全有”或“全无”的区别。效度是针对测验结果的。

内部效度。研究的内部效度是指在研究的自变量与因变量之间存在一定关系的明确程度。如果自变量和因变量之间关系并不会由于其它变量的存在受到影响,从而变得模糊不清或复杂化,那么这项研究就具有内部效度。它所涉及的问题是:所研究的两个或多个变量之间是否存在一定的关系?是否确实是自变量的变化引起了因变量的变化?

研究设计要对可能涉及的各种变量进行有效的控制与消除,使与研究目标无关的变量对研究结果的影响很小或没有影响。因而,研究变量之间(如自变量与因变量之间)的关系是确定的和真实的,意味着一项研究的内部效度高。

影响内部效度的因素比较多,归纳起来,主要有历史、研究被试、研究手段方法和程序、统计回归效应四方面因素。

内部效度的条件。研究的内部效度不会自动形成。内部效度的获得主要是通过研究设计,认真细致地选择变量,切实控制好各种变量,保证研究变量之间的确定关系,消除与研究目标无关的变量对研究结果的影响。上述4种方面的因素,都是在研究中应特别注意控制的,最有效的途径是采用随机化程序。对于教育科学研究的各种具体情况(例如不同的研究活动),影响内部效度的因素种类、数量、作用大小会有一定的差别,应该根据具体情况加以分析、预估、识别、并采取适当措施予以控制或消除,以提高研究的内部效度。

外部效度。研究的外部效度是指研究结果能够一般化和普遍适用到样本来自的总体和到其它的总体中的程度,即研究结果和变量条件、时间和背景的代表性和普遍适用性。外部效度可以细分为总体效度和生态效度两类。

总体效度指研究结果能够适应于研究样本来自总体的程度与能力,或说对总体的普遍意义。要使研究结果适用于总体,就必须从总体中随机选取样本,使样本对总体具有代表性。如果研究所选样本有偏差或数量太小,不足以代表总体,其结果就难以对总体特征进行概括。

生态效度是指研究结果可以被概括化和适应于其它研究条件和情景的程度和能力。要使研究结果能够适用于其它研究条件和情景(例如,自变量与因变量、研究程序、研究背景、研究时间和研究者等方面的不同),就必须特别设计研究条件与情景,保证对其它条件、情景有代表性。

一般认为,内部效度是外部效度的必要条件,但不是充分条件。内部效度低的研究结果就谈不上对其它情景的普遍意义;可是内部效度高的研究,其结果却不一定能够一般化到其它总体和背景中去。教育科学研究的重要意义是要发现教育活动的普遍规律,指导教育工作的开展。因此,提高研究结果的外部效度十分重要。一项研究的内部效度再高,如果其结果仅适应于特定的范围,特定的测量工具、特定研究程序和特定的研究条件等,那么,从获取一般知识和揭示普遍规律的角度来看,其价值、意义不大。因此,研究的外部效度与内部效度在重要性上毫不逊色。

结构效度。研究的构思效度是指理论构思或假设的合理性、科学性,及其转换为研究目标的恰当程度和可操作性。它涉及建立研究方案和测量指标的理论构思(或观察指标的理论设想)及其操作化等方面的问题,即理论构思及其转换的有效性。为了使研究具有较高的构思效度,研究的理论构思首先要结构严谨、层次分明,形成某种“构思网络”,其次对研究内容做出严格的抽象与操作性定义(如针对研究构思的特点,给予明确的操作定义)。

心理测验对某一理论概念或特质测量的程度。因此,研究构思效度就是要搞清楚:测验测量的是什么构思(概念或特质)?测验分数的变异中有多少来自于测验的理论构思?结构效度是没有单一指标的,它是由各方面证据累积起来作出评价的。

影响结构效度的因素主要有3方面:研究构思方面、研究手段和程序方面、实验者的主观期望和被试者对研究的假设。

使研究具有较高的结构效度,应该满足以下4个条件:

  1. 理论构思要结构严谨、符合逻辑、层次分明,形成某种“构思网络”。例如,将儿童的自我意识发展分为自我认识、自我体验和自我控制三方面,而自我认识进一步细分为对生理自我的认识、对心理自我的认识和对社会自我的认识。这样的理论构思,就比较严谨、完整,有层次,并且形成一种“网络”,便于理解和研究。
  2. 清晰、准确的界定研究的环境条件和变量。例如,“小学五年级学生发散思维问题研究”这样一个课题,对研究被试的年龄段,生理智力发展,学习、生活、社会环境等需要明确界定范围,用文字和语言两种形式完整、准确地表述研究变量。
  3. 对研究变量做出准确、严格的操作定义,并选择对应、客观的观测指标。
  4. 避免采用单一方法或单一指标去代表或分析多维的、多层次的、多侧面的事物和活动,尽可能采用多种方法、多种指标,从不同角度分析研究相同的理论构思。

统计效度。关于研究的数据分析处理程序的效度检验,或者说,它是检验研究结果的数据分析程序与方法的有效性的指标。统计结论效度的基本问题是研究误差、变异来源与如何适当地运用统计显著性检验,它不涉及系统性偏差的来源问题,而是研究误差变异情况和如何适当运用统计显著性检验的问题。例如,采用小样本的研究数据时,由于样本成分与测量数据都波动比较大,稳定性差,如果依赖统计显著性水平做出推论是不可靠的。在这种情况下,应该运用功效分析(power analysis),看看一定的样本范围、变异程度和α水平上能够检验出多大的效应。这就是统计结论效度所考虑的问题。

研究的统计结论效度主要取决于两个方面的条件:一是数据的质量,数据分析程序的效度是以数据的质量作为基础的,数据质量差的研究是谈不上统计结论效度的;二是统计检验方法,数据分析中所采用的各种统计方法,都有其明确的统计检验条件的要求,一项研究中统计检验条件不明确或者被违反,就会显著降低统计结论效度。

表面效度。表面效度是指:一个测验看起来好象是测量所要测的东西的程度。换句话说,当那些未经过训练的被试或测验应用者认为某测验是有效的测验时,该测验就有表面效度。

内容效度。内容效度指的是测验题目对有关内容或行为取样的适用性,从而确定测验是否是所欲测量的行为领域的代表性取样。测验题目对有关内容或行为总体取样的适当性程度。因为这种效度主要是考察测验的内容,因此叫内容效度。要想使测验的内容效度高,必须具备两个条件:内容的范围或行为总体必须界定明确;测验题目应该是所界定的内容范围的代表性样本。

内容效度的评价方法:专家判断法、统计分析法(评分者信度\复本信度\分半信度\再测法)、经验推测法(实验检验)。内容效度经常与表面效度(face validity)混淆。表面效度是由外行对测验作表面上的检查确定的,它不反映测验实际测量的东西,只是指测验表面上看来好像是测量所要测的东西;内容效度是由够资格的判断者(专家)详尽地、系统地对测验作评价而建立的。

结构效度指测验能够测量到理论上的构想或特质的程度,即测验的结果是否能证实或解释某一理论的假设、术语或构想,解释的程度如何。一是通过对测验本身的分析(用内容效度来验证构想效度),二是通过测验间的相互比较,如效标效度(与已成熟的相同测验间的比较)、区分效度(与近似或应区分测验间的比较)、因素分析法。

效标效度。效标即衡量测验有效性的参照标准,指的是可以直接而且独立测量的我们感兴趣的行为。我们感兴趣的行为,就是要预测的行为,这是一个总的观念,故必须以可操作的测量来确定才有实际意义。因此有必要把效标细分为两个层次,其一是理论水平的“观念效标”,其二是操作定义水平的“效标测量”。

效标效度又称实证效度,反映的是测验预测个体在某种情境下行为表现的有效性程度。根据效标资料是否与测验分数同时获得,又可分为同时效度(实际士气高和士气低的人在士气测验中的得分一致性)和预测效度两类。常见的效标包括:学业成就、实际工作业绩、特殊训练成绩、精神病诊断、等级评定等。

一个好的效标须具备以下条件:(1)效标必须能最有效地反映测验的目标,即效标测量本身必须有效;(2)效标必须具有较高的信度,稳定可靠,不随时间等因素而变化;(3)效标可以客观地加以测量,可用数据或等级来表示;(4)效标测量的方法简单,省时省力,经济实用。

效标效度评估的方法主要是相关法。效度系数是最常用的效度指标,尤其是效标效度。它是以皮尔逊积差相关系数来表示的,主要反映测验分数与效标测量的相关。当测验成绩是连续变量,而效标资料是二分变量时,计算效度系数可用点二列相关公式或二列相关公式;当测验分数为连续变量,效标资料为等级评定时,可用贾斯朋多系列相关公式计算。