第二章第三節效度:量表真的測到研究者想測的構念嗎?

第二章第三節效度:量表真的測到研究者想測的構念嗎?


例如,研究者想測量「藥師對藥局選址系統的信任」,卻設計了以下題目:

  1. 系統的畫面配色很好看。
  2. 系統的字體清楚易讀。
  3. 系統的版面配置令人舒適。
  4. 系統的圖示設計很美觀。

這些題目的回答可能高度一致,Cronbach’s α也可能很高,但它們測量的比較像「介面美感」,而不是「系統信任」。

因此,在確認量表具有信度後,還必須繼續評估效度。

效度想回答的核心問題是:

根據這些量表分數所作出的解釋與使用,是否有足夠證據支持?


一、什麼是效度?

效度是指研究者對測量結果所作的解釋,是否符合原先想測量的構念及研究用途。

假設研究者宣稱:

這份量表可以測量藥師對藥局選址系統的信任程度。

那麼研究者需要提供證據,說明:

  • 題目內容確實涵蓋系統信任。
  • 測量相同構念的題項能夠聚集在一起。
  • 系統信任與其他構念可以適當區分。
  • 量表分數與理論上相關的外部結果具有合理關聯。
  • 量表結果不是主要由題目形式、共同作答方式或其他偏誤造成。

因此,效度不是單一統計數字,而是一組累積證據。


二、效度不是量表永久不變的標籤

研究者有時會寫:

本研究採用經過信效度驗證的成熟量表,因此不需要再次檢驗。

這種說法並不嚴謹。

一份量表過去曾經具有良好的效度證據,不代表它在所有情境中都一定有效。效度可能受到以下因素影響:

  • 受訪者族群不同
  • 語言不同
  • 文化背景不同
  • 時間與社會環境不同
  • 題目被刪除或修改
  • 作答方式改變
  • 原本紙本問卷改成線上問卷
  • 構念在新情境中的意義不同

例如,一份原本用於一般消費者的「科技信任量表」,改用在專業藥師身上時,受訪者可能以不同標準理解資料可靠性、演算法透明度及專業責任。

因此,更精確的說法是:

目前的效度證據是否支持在特定族群、情境及用途下,對量表分數作出預定解釋?

效度不是量表取得一次認證後便永久有效,而是需要持續累積與重新檢查的證據。


三、信度與效度有什麼關係?

信度與效度有關,但不是同一件事。

信度關心

測量結果是否一致、穩定?

效度關心

這個一致、穩定的分數,是否真的代表研究者想測量的概念?

可以用射箭來理解。

情況一:信度低、效度低

箭散落在靶面各處,表示測量結果不穩定,也沒有準確反映目標。

情況二:信度高、效度低

箭集中在同一處,但偏離靶心。表示測量結果很一致,卻一致地測錯了目標。

情況三:信度高、效度高

箭集中在靶心附近,表示測量結果具有一致性,也符合預定目標。

因此:

信度通常是良好測量的重要基礎,但高信度不能自動證明高效度。


四、內容效度

內容效度是指量表題目是否充分且適當地涵蓋構念內容。

它主要回答:

這些題目是否代表了研究者想測量概念的重要範圍?

例如,研究者想測量「藥局選址系統信任」,根據理論可能包含:

  • 資料正確性
  • 資料來源可靠性
  • 評分方式可信度
  • 系統運作一致性
  • 對推薦結果的信心

如果量表只詢問「系統介面是否好看」,便無法充分涵蓋系統信任。

如果量表只詢問「資料是否正確」,也可能過於狹窄,因為信任不一定只包含資料正確性。


五、內容不足與內容污染

內容效度常見兩種問題。

(一)內容不足

內容不足是指題目沒有涵蓋構念的重要面向。

例如,「藥局選址系統信任」理論上包含:

  • 資料信任
  • 演算法信任
  • 推薦結果信任

但問卷只測量資料信任,便可能遺漏其他重要內容。

(二)內容污染

內容污染是指量表混入不屬於該構念的內容。

例如,系統信任量表中加入:

我覺得系統畫面很漂亮。

這道題可能測量介面美感,而不是信任。

量表如果同時出現內容不足與內容污染,即使內部一致性看起來不錯,也可能無法支持研究者的構念解釋。


六、如何建立內容效度?

內容效度主要依靠理論、文獻及專業判斷,不能只靠統計軟體完成。

常見流程包括:

  1. 清楚定義構念。
  2. 確認構念包含哪些面向。
  3. 依理論與文獻建立題庫。
  4. 比較既有量表與研究情境。
  5. 邀請領域專家審查題目。
  6. 進行認知訪談。
  7. 進行小規模預試。
  8. 根據結果修正題目。

七、專家審查要看什麼?

專家可以評估:

  • 題目與構念的相關性
  • 題目文字的清楚程度
  • 內容涵蓋是否完整
  • 題目是否重複
  • 題目是否包含兩個問題
  • 題目是否符合目標族群
  • 題目是否具有文化與語言適切性

例如,可以請專家將每一題的內容相關性評為:

  1. 不相關
  2. 需要大幅修改
  3. 相關但需要小幅修改
  4. 高度相關

研究者可以據此計算內容效度指數,例如題項層級的I-CVI及量表層級的S-CVI。

但內容效度指數也不是自動刪題規則。結果會受到:

  • 專家人數
  • 專家背景
  • 評分尺度
  • 專家是否了解構念定義

等因素影響。

因此,論文不能只報告一個CVI數字,還應說明專家如何選擇、使用什麼標準,以及如何根據意見修改題目。


八、表面效度是什麼?

表面效度是指從受訪者或一般使用者的角度來看,題目是否看起來像在測量預定構念。

例如,「系統信任量表」中的題目:

我相信這套系統提供的資料是可靠的。

表面上確實與系統信任有關。

但如果題目是:

我每天使用手機超過三小時。

這道題表面上就不太像是在測量系統信任。

表面效度可以透過:

  • 受訪者訪談
  • 認知訪談
  • 預試回饋
  • 專家判斷

進行檢查。

然而,表面效度只是初步判斷。題目看起來合理,不代表它在理論與統計上真的具有良好效度。


九、收斂效度

收斂效度是指用來測量相同構念的不同題項或方法,是否能夠呈現合理程度的一致性。

它主要回答:

如果這些題目真的都在測量同一個構念,它們是否會聚集在一起?

例如,以下四道題目都用來測量「知覺有用性」:

  1. 系統能提升選址效率。
  2. 系統能改善選址決策品質。
  3. 系統能幫助比較候選地點。
  4. 系統能減少蒐集資料的時間。

如果這四題確實測量相同構念,它們在因素分析中應該對「知覺有用性」因素具有合理負荷量。


十、什麼是因素負荷量?

因素負荷量可以初步理解為:

題項與潛在因素之間的關聯程度。

因素負荷量越高,表示該題項與預定構念的關係越強。

例如:

題項知覺有用性因素負荷量
系統提升選址效率.82
系統改善決策品質.79
系統幫助比較地點.74
系統減少資料蒐集時間.68

這組結果表示四題都與知覺有用性具有一定關係。

實務上常見以.50或.70作為參考,但不應把任何門檻當作不可變動的規則。因素負荷量的判斷還應考慮:

  • 理論重要性
  • 樣本數
  • 研究階段
  • 題目數量
  • 測量誤差
  • 模型整體適配度
  • 題項是否具有交叉負荷

十一、平均變異萃取量

在驗證性因素分析或結構方程模型中,研究者常使用平均變異萃取量(Average Variance Extracted,AVE)評估收斂效度。

AVE可以理解為:

一個構念平均能夠解釋其題項多少比例的變異。

如果AVE較高,表示題項變異中有較多部分可以由共同構念解釋;如果AVE較低,表示題項可能包含較多測量誤差,或與構念的關係不足。

實務上常以:

$$ AVE \geq .50 $$

作為參考,意思是構念平均能解釋題項一半以上的變異。

但這仍然是參考門檻,不應脫離其他證據單獨判斷。

若AVE略低於.50,但:

  • 題項負荷量大致合理
  • 組合信度良好
  • 理論內容重要
  • 模型整體表現合理

研究者可能仍選擇保留構念,但必須清楚說明理由,不能直接宣稱收斂效度完全沒有問題。


十二、組合信度

組合信度通常寫作CR,是根據題項因素負荷量與測量誤差估計構念分數的一致性。

它和Cronbach’s α都涉及內部一致性,但計算基礎不同:

  • α對題項具有較強的等值假設。
  • CR會利用因素模型中的負荷量。
  • McDonald’s ω與CR在某些模型下概念相近,但不能不加區分地完全視為同一指標。

實務研究有時將CR大於.70視為可接受的初步參考,但仍應考慮研究目的與模型品質。

收斂效度通常不能只靠CR判斷,應搭配:

  • 因素負荷量
  • AVE
  • 理論內容
  • 模型適配度
  • 題項表現

共同評估。


十三、區辨效度

區辨效度是指理論上不同的構念,能否在測量結果中適當區分。

它主要回答:

研究者宣稱是不同概念的兩個構念,是否真的具有足夠差異?

例如,科技接受相關研究可能同時包含:

  • 知覺有用性
  • 知覺易用性
  • 系統信任
  • 使用意願

這些構念可能彼此相關,但不應完全相同。

例如:

  • 知覺有用性:系統是否能改善工作表現?
  • 知覺易用性:系統是否容易學習及操作?
  • 系統信任:系統資料與結果是否值得信賴?
  • 使用意願:未來是否願意使用系統?

如果「知覺有用性」與「使用意願」的題目無法區分,研究者便很難合理解釋兩個構念在模型中的不同角色。


十四、相關很高就代表沒有區辨效度嗎?

兩個構念相關很高,可能表示區辨效度不足,但不能只根據一個相關係數就下結論。

高相關可能來自:

  • 兩個構念理論上高度接近
  • 題目文字過度相似
  • 受訪者無法理解概念差異
  • 同一時間、同一問卷及同一量尺造成共同方法影響
  • 樣本過於同質
  • 構念在特定情境中實際難以區分

研究者需要同時檢查題目內容、因素模型及區辨效度指標。


十五、Fornell–Larcker準則

Fornell–Larcker準則是一種傳統區辨效度檢查方式。

其基本概念是:

一個構念與自身題項所共享的變異,應高於它與其他構念共享的變異。

實務表格通常將各構念AVE的平方根放在對角線,再與構念間相關比較。

例如:

構念有用性易用性信任
有用性.78
易用性.55.81
信任.62.48.84

對角線是各構念AVE的平方根。如果每個對角線數值都大於該構念與其他構念的相關,通常可提供區辨效度的初步證據。

但是,Fornell–Larcker準則對某些區辨效度問題的敏感度有限,不能作為唯一依據。


十六、HTMT是什麼?

HTMT是Heterotrait–Monotrait Ratio的縮寫,常用於評估兩個構念之間是否過度相似。

簡單來說,它比較:

  • 不同構念題項之間的相關
  • 同一構念題項之間的相關

如果兩個構念實際上難以區分,HTMT通常會偏高。

實務上常見的參考標準包括:

$$ HTMT<.85 $$

或較寬鬆的:

$$ HTMT<.90 $$

但.85與.90不是放諸四海皆準的及格線。若兩個構念理論上非常接近,判斷方式可能與差異明顯的構念不同。

除了點估計,也可以使用Bootstrap信賴區間,檢查HTMT的區間是否包含1。

較完整的區辨效度評估應結合:

  • 題目內容
  • 構念相關
  • 因素負荷量
  • 交叉負荷
  • Fornell–Larcker準則
  • HTMT
  • 競爭模型比較
  • 理論可區分性

十七、區辨效度不足怎麼辦?

如果兩個構念無法區分,不應立即刪題到指標通過。

研究者應先思考:

  1. 兩個構念在理論上真的不同嗎?
  2. 構念定義是否重疊?
  3. 題目文字是否幾乎相同?
  4. 題目是否被錯誤歸類?
  5. 是否為翻譯造成的語意混淆?
  6. 是否存在共同方法偏誤?
  7. 兩個構念是否應合併?
  8. 是否需要重新蒐集資料驗證?

如果理論上兩個構念本來就難以區分,硬把它們拆成兩個變項,可能只是為了配合研究模型,而不是忠實反映資料與理論。


十八、效標關聯效度

效標關聯效度是指量表分數是否與某個具有實際意義的外部效標呈現合理關聯。

它主要回答:

量表分數能否對應研究領域中重要的外部結果?

例如,「藥局選址系統使用意願」量表可以與下列效標比較:

  • 實際註冊系統
  • 試用系統
  • 使用次數
  • 是否購買服務
  • 是否採納系統建議
  • 後續持續使用情形

如果使用意願分數較高的人,後續確實更可能註冊或使用系統,便能提供效標關聯效度的證據。

但即使兩者相關不高,也不一定代表量表完全無效,因為實際行為還可能受到:

  • 價格
  • 時間
  • 權限
  • 組織政策
  • 同事意見
  • 市場條件

等因素影響。


十九、同時效度與預測效度

效標關聯效度常依時間關係分成兩類。

(一)同時效度

量表與效標大致在同一時間測量。

例如,同一天測量:

  • 系統信任量表分數
  • 是否願意立即試用系統

如果兩者具有合理關聯,可以提供同時效度證據。

(二)預測效度

量表先測量,效標在未來才發生。

例如:

  1. 第一個月測量使用意願。
  2. 三個月後觀察實際使用行為。

如果先前的使用意願能預測後續使用,便能提供預測效度證據。

從時間順序來看,預測效度比同時測量更接近實際預測用途。但即使能預測,也不等於量表分數對結果具有因果作用。


二十、如何選擇適當效標?

外部效標本身也必須具有合理品質。

如果用來驗證量表的效標測量不準確,效標關聯可能被低估或扭曲。

例如,以「自我報告的實際系統使用次數」作為效標,可能受到回憶錯誤或社會期許影響。若能取得系統後台的真實登入紀錄,通常會是更直接的效標。

選擇效標時應考慮:

  • 是否與構念理論相關
  • 是否具有實際意義
  • 測量是否可靠
  • 時間順序是否合理
  • 是否受到其他因素嚴重影響
  • 是否與量表使用目的一致

二十一、已知群體效度

有些研究會比較理論上應具有不同分數的群體。

例如,如果具有多年GIS系統使用經驗的藥師,理論上對選址系統的操作自我效能應高於從未接觸相關系統者,量表若能反映這項差異,便可提供已知群體效度的證據。

但這種比較仍須小心:

  • 群體是否真的只在目標構念上不同?
  • 是否存在年齡、教育或科技經驗等混淆因素?
  • 群體差異是否具有足夠理論依據?
  • 未達顯著是否可能來自樣本數不足?

已知群體差異只是效度證據之一,不能單獨證明量表完全有效。


二十二、效度應該由哪些證據共同支持?

效度不是「通過一個檢定」便完成。

較完整的效度證據可能包括:

證據來源主要問題
構念與題目內容題項是否代表構念的重要內容?
作答過程受訪者是否按照研究者預期理解題目?
內部結構題項是否形成合理因素結構?
與其他變項的關係是否呈現預期的收斂、區辨及效標關係?
使用後果量表的實際使用是否產生合理或不合理後果?

這種觀點強調,效度是對分數解釋與用途的整體評估,而不只是幾個統計指標。


二十三、什麼是共同方法偏誤?

共同方法偏誤是指變項之間的關聯,部分來自共同的測量方法,而不是構念之間真正的關係。

例如,在同一份線上問卷中,由同一位受訪者、同一時間、使用相同的五點量尺測量:

  • 知覺有用性
  • 系統信任
  • 使用意願

這些變項可能因為共同作答方式而產生額外相關。

共同方法來源可能包括:

  • 同一位受訪者同時回答自變項與依變項
  • 所有題目使用相同量尺
  • 題目排列造成前後影響
  • 受訪者傾向一致作答
  • 社會期許
  • 猜測研究目的
  • 正面或負面情緒
  • 題目文字過度相似
  • 同一時間點測量所有變項

因此,研究中觀察到的高相關,不一定完全代表構念間的真實關係。


二十四、共同方法變異與共同方法偏誤有何差異?

共同方法變異是指由測量方法所引起的變異。

共同方法偏誤則是指這些方法變異進一步使參數估計或研究結論產生偏差。

共同方法並不一定都會造成嚴重偏誤。例如,所有題目使用相同五點量尺並不代表研究結果必然無效;但它可能增加風險,需要在研究設計與分析中評估。

因此,不宜看到同源自陳問卷就直接斷言研究存在嚴重共同方法偏誤,也不能完全忽略這項問題。


二十五、為什麼不能只靠Harman單因子檢定?

Harman單因子檢定是常見但限制很大的做法。

一般操作方式是:

  1. 將所有題項一起進行未旋轉因素分析。
  2. 查看是否只形成一個因素。
  3. 或查看第一個因素解釋的變異比例是否超過某個門檻。

有些研究據此寫道:

第一因素解釋變異未超過50%,因此不存在共同方法偏誤。

這項結論通常過度推論。

Harman單因子檢定的主要限制包括:

  • 對共同方法偏誤的敏感度不足。
  • 無法辨識多種不同的方法因素。
  • 第一因素未超過固定比例,不代表偏誤不存在。
  • 第一因素比例較高,也不一定完全由共同方法造成。
  • 結果受到題項數量、構念數量及因素分析設定影響。
  • 它無法取代良好的研究設計。

因此,Harman檢定最多只能作為非常粗略的補充資訊,不能單獨證明不存在共同方法偏誤。


二十六、如何在研究設計階段降低共同方法偏誤?

共同方法偏誤最好在資料蒐集前就處理,而不是等資料收完後才依賴統計檢定。

(一)分開資料來源

例如:

  • 自變項由藥師填答。
  • 系統使用行為由後台紀錄取得。
  • 營運績效由實際資料取得。
  • 服務品質由顧客評估。

不同變項來自不同資料來源,可以降低共同作答方式造成的關聯。

(二)分開測量時間

例如:

  • 第一階段測量知覺有用性與系統信任。
  • 一個月後測量使用意願或實際使用。

時間分離可以降低受訪者刻意保持答案一致及短期情緒的影響,但也可能增加樣本流失。

(三)改善題目設計

包括:

  • 使用清楚、簡短的題目。
  • 避免模糊概念。
  • 避免雙重問題。
  • 避免不同構念使用幾乎相同文字。
  • 避免讓研究假設過於明顯。
  • 適當安排題目順序。

(四)保障匿名與降低評價焦慮

向受訪者說明:

  • 問卷沒有標準答案。
  • 回答僅供研究分析。
  • 個人資料不會被識別。
  • 應依實際感受作答。

這可以減少社會期許與迎合研究者的回答。

(五)使用不同測量形式

在理論與研究設計允許下,可以讓不同構念採用不同來源或測量方式,但不能為了形式不同而任意破壞既有量表。


二十七、有哪些統計方法可以檢查共同方法問題?

可能的方法包括:

  • 標記變項法
  • CFA標記技術
  • 未測量潛在方法因素
  • 比較包含與不包含方法因素的模型
  • 多特質多方法模型

但這些方法各自具有假設與限制。

例如,潛在方法因素模型可能:

  • 難以收斂
  • 需要較大樣本
  • 出現識別問題
  • 方法因素缺乏清楚實質意義
  • 將其他模型錯誤吸收到方法因素中

因此,不能認為只要加入一個共同方法因素,便已完全排除偏誤。

較合理的策略是:

以研究設計預防為主,統計診斷為輔,並誠實說明仍可能存在的限制。


二十八、效度不足時應該怎麼辦?

發現效度問題後,不應只為了讓統計指標過關而反覆刪題。

應先判斷問題來源。

如果內容效度不足

可以:

  • 重新定義構念。
  • 補充遺漏的重要面向。
  • 重新進行文獻回顧與專家審查。
  • 進行認知訪談。

如果收斂效度不足

可以檢查:

  • 題目是否與構念相關。
  • 題目是否表達不清。
  • 是否存在反向題方法效應。
  • 因素模型是否設定錯誤。
  • 題目是否具有足夠變異。
  • 量表是否實際包含多個構面。

如果區辨效度不足

可以檢查:

  • 兩個構念是否理論重疊。
  • 題目文字是否過度相似。
  • 構念是否應合併。
  • 是否存在共同方法問題。
  • 模型是否過度複雜。

如果效標關聯效度不足

可以檢查:

  • 外部效標是否可靠。
  • 測量時間是否合理。
  • 理論預期是否正確。
  • 是否存在範圍限制。
  • 實際行為是否受其他條件阻礙。

若效度問題嚴重,最誠實的做法可能是重新修改量表並蒐集新資料,而不是強行宣稱量表已通過驗證。


二十九、論文中如何報告效度?

不建議只寫:

本研究量表均通過效度檢驗。

這句話沒有說明:

  • 檢查哪一種效度
  • 使用什麼方法
  • 得到什麼結果
  • 是否存在例外
  • 結論能支持到什麼程度

較完整的寫法可以是:

本研究首先依理論定義及既有文獻建立題項,並邀請相關領域專家審查題目內容,以評估內容適切性。驗證性因素分析結果顯示,各題在預定構念上的標準化因素負荷量介於.64至.87。各構念的平均變異萃取量介於.52至.69,組合信度介於.79至.90,為收斂效度提供支持。區辨效度方面,各構念HTMT值均低於預先設定的判斷標準,且信賴區間未包含1。整體結果支持在本研究樣本及使用情境下,對各構念分數作出預定解釋。

如果部分指標未達參考值,應如實說明:

系統信任構念的AVE為.47,略低於一般參考值。雖然其組合信度及因素負荷量大致可接受,但收斂效度證據仍有限,因此相關結果應審慎解釋。

這比直接宣稱「所有效度均良好」更符合研究誠信。


三十、效度分析表格範例

收斂效度

構念題項標準化因素負荷量CRAVE
知覺有用性PU1~PU4.68~.84.86.61
知覺易用性PE1~PE4.65~.82.84.57
系統信任TR1~TR5.70~.88.90.64
使用意願BI1~BI3.72~.86.85.66

區辨效度

構念知覺有用性知覺易用性系統信任使用意願
知覺有用性
知覺易用性.68
系統信任.74.59
使用意願.79.63.76

如果此表呈現的是HTMT值,論文必須在表名或註解中清楚標示,不能讓讀者誤以為它是一般相關矩陣。


三十一、常見錯誤

效度分析常見的錯誤包括:

  1. 將高Cronbach’s α當成效度證據。
  2. 認為採用成熟量表便不必重新檢查。
  3. 只看因素負荷量,不檢查構念內容。
  4. 只用AVE判斷所有收斂效度。
  5. 只用Fornell–Larcker準則評估區辨效度。
  6. 為使AVE或HTMT通過門檻而反覆刪題。
  7. 刪題後沒有重新思考構念定義。
  8. 將不同構念高度相關直接解釋為因果關係。
  9. 使用不可靠的外部效標檢查效標效度。
  10. 把預測效度誤寫成因果效果。
  11. 只靠Harman單因子檢定宣稱沒有共同方法偏誤。
  12. 所有資料都來自同一份問卷,卻完全不討論共同方法問題。
  13. 翻譯或修改題目後,直接沿用原研究效度結論。
  14. 把參考門檻當成絕對真理。
  15. 只寫「通過效度檢驗」,不報告具體證據。

三十二、本節重點

效度關心的不是量表分數是否一致,而是:

研究者對量表分數所作的解釋及用途,是否有足夠證據支持?

本節的四種主要效度包括:

內容效度

題項是否充分且適當地涵蓋構念內容。

收斂效度

測量相同構念的題項是否能合理聚集,可以參考因素負荷量、AVE及組合信度等證據。

區辨效度

理論上不同的構念是否能夠彼此區分,可以結合題目內容、構念相關、Fornell–Larcker準則、HTMT及競爭模型判斷。

效標關聯效度

量表分數是否與具有實際意義的外部效標呈現合理關係,包括同時效度與預測效度。

此外,共同方法偏誤不能只靠單一統計檢定排除,尤其不能只根據Harman第一因素未超過某個比例,就宣稱問題不存在。較合理的方式是在研究設計階段透過不同資料來源、時間分離、改善題目與匿名作答降低風險,再以適當統計方法作為輔助診斷。

最重要的是:

效度不是一個通過或不通過的單一檢定,也不是量表永久不變的認證,而是根據理論、內容、作答過程、內部結構及外部關係逐步累積的證據。

下一節將進一步介紹因素分析,說明研究者如何探索或檢驗題項背後的構念結構,以及EFA與CFA為什麼不能混為一談。

留言

點擊「載入留言」後顯示 Disqus。