第二章第一節Likert題項與量表:從一個選項到一個可分析的構念
2.1 Likert題項與量表:從一個選項到一個可分析的構念
在管理學、教育、心理學及資訊系統研究中,許多重要概念無法直接用尺或儀器測量。
例如:
- 使用者滿意度
- 購買意願
- 科技接受度
- 知覺有用性
- 工作壓力
- 創業意願
- 對藥局選址系統的信任程度
這些概念不能像年齡、距離或收入一樣直接取得客觀數值。研究者通常需要設計數個陳述句,請受訪者表達同意程度,再以這些回答推估背後的抽象概念。
這種抽象且無法直接觀察的概念,通常稱為「構念」;用來測量構念的具體問題,則稱為「題項」。
Likert題項便是測量這類態度、認知與意向時最常使用的方法之一。
一、什麼是Likert題項?
Likert題項通常提供一個陳述句,再請受訪者從具有順序的選項中選擇最符合自身狀況的答案。
例如,研究者想了解藥師對藥局選址系統的知覺有用性,可以設計以下題目:
我認為這套系統能提升藥局選址的效率。
回答選項可能是:
- 非常不同意
- 不同意
- 普通
- 同意
- 非常同意
這一個陳述句就是一個Likert題項。
它具有兩個主要特徵:
- 題目通常是一個態度或認知陳述。
- 回答選項具有明確順序。
Likert題項不一定只能使用五個選項,也可能使用:
- 四點量尺
- 五點量尺
- 六點量尺
- 七點量尺
最常見的是五點及七點量尺。
二、Likert題項與Likert量表不是同一件事
這是研究中很常被混用的兩個概念。
(一)Likert題項
單一Likert題項是指一道問題。
例如:
我認為這套系統提供的資訊值得信任。
受訪者從1至5分中選擇一個答案。這只是單一題項,可能只反映受訪者對某一個具體陳述的回答。
(二)Likert量表
Likert量表通常由數個用來測量同一構念的題項組成,再將這些題目的分數加總或取平均。
例如,「知覺有用性」可能包含四個題項:
- 這套系統能提升我的選址效率。
- 這套系統能幫助我比較不同候選地點。
- 這套系統能降低蒐集商圈資料的時間。
- 這套系統提供的資訊有助於選址決策。
如果四題都使用1至5分作答,研究者可以計算:
$$量表總分=X_1+X_2+X_3+X_4$$
也可以計算:
$$ 量表平均分數= \frac{X_1+X_2+X_3+X_4}{4} $$
假設某位受訪者的回答分別是4、5、4、3,則:
$$ 總分=4+5+4+3=16 $$
$$ 平均分數=\frac{16}{4}=4 $$
這個4分不再只是某一題的回答,而是由四個題項共同形成的「知覺有用性」量表分數。
因此:
一個題目是Likert題項;數個測量相同構念的題項組合起來,才形成Likert量表。
三、單一Likert題項為什麼通常是次序資料?
單一Likert題項的回答具有大小順序。
以五點量尺為例:
$$ 非常不同意 < 不同意 < 普通 < 同意 < 非常同意 $$
我們知道「非常同意」的同意程度高於「同意」,而「同意」又高於「普通」。
但問題是,相鄰選項之間的心理距離未必相等。
例如:
- 「非常不同意」與「不同意」之間的差距,是否等於「普通」與「同意」之間的差距?
- 從1分提高到2分,是否與從4分提高到5分具有相同意義?
研究者通常無法直接證明這些心理距離完全相等。
因此,單一Likert題項在測量理論上通常被視為次序資料,而不是嚴格的等距資料。
數字只是編碼
將回答選項編成1、2、3、4、5,並不會自動使它變成連續變項。
數字在這裡首先代表的是回答順序:
- 1代表非常不同意
- 2代表不同意
- 3代表普通
- 4代表同意
- 5代表非常同意
不能因為答案被輸入成數字,就忽略它原本是具有順序的類別資料。
四、單一題項能不能計算平均數?
從嚴格的測量尺度觀點來看,單一Likert題項是次序資料,比較適合報告:
- 各選項的次數
- 各選項的百分比
- 中位數
- 四分位距
例如:
在200位受訪藥師中,18%選擇非常不同意、22%選擇不同意、20%選擇普通、30%選擇同意,另有10%選擇非常同意。
這種呈現方式保留了各回答類別的完整分布。
實務研究中,研究者也常計算單一題項的平均數,例如報告平均滿意度為3.42分。這種做法相當普遍,但實際上隱含了一項假設:
研究者將1至5分之間的距離近似視為相等。
在樣本數適當、回答選項有五點以上,而且分布不過度偏斜時,某些統計方法對這種近似處理可能具有一定穩健性。不過,研究者不應把「實務上經常這樣做」誤認為「單一Likert題項本來就是連續資料」。
因此,較審慎的做法是:
- 若重點是描述單一題目的回答,優先報告次數與百分比。
- 若報告平均數,最好同時呈現回答分布。
- 若正式推論高度依賴單一題項,應考慮次序資料的分析方法。
- 不要僅因統計軟體能計算平均數,就認定這種處理必然合理。
五、多個Likert題項為什麼常近似視為連續變項?
當數個題項共同測量同一個構念,並加總或取平均形成量表分數時,可取得的分數範圍會增加。
例如,五個題項都採1至5分:
- 最低總分為5分。
- 最高總分為25分。
- 中間可能出現許多不同的分數。
相較於單一題項只有五個選項,多題量表的總分通常更接近連續分布。
此外,一個抽象構念往往具有多個面向,單一題目容易受到:
- 題目措辭
- 當下情緒
- 個人理解
- 特定情境
- 隨機回答誤差
等因素影響。
使用多個題項,可以讓不同題目的測量誤差在某種程度上互相平衡,使量表分數比單一題項更穩定。
因此,管理學與社會科學研究經常將多題Likert量表的加總分數或平均分數近似視為連續變項,並使用:
- 平均數與標準差
- t檢定
- ANOVA
- Pearson相關
- 線性迴歸
- 結構方程模型
但這種做法不是無條件成立。
六、多題量表可以視為連續變項的條件
多個Likert題項加總後,不代表一定可以合理地當作連續變項。至少需要考慮以下問題。
(一)題項是否測量同一個構念?
如果幾道題目測量的是不同概念,就不能只因為都使用1至5分,便把它們加總。
例如:
- 我認為系統操作很容易。
- 我認為系統資料很可靠。
- 我願意付費購買這套系統。
- 我所在藥局的營業額很高。
這四題分別涉及:
- 易用性
- 信任
- 付費意願
- 經營績效
它們並不是同一構念,直接加總成一個總分沒有清楚的理論意義。
題項能否組成量表,首先應由理論和量表設計決定,之後才透過信度與因素分析提供經驗證據。
(二)題項的計分方向是否一致?
如果高分在某些題目代表正向態度,在另一些題目代表負向態度,就必須先處理反向題,才能計算總分或平均分數。
(三)量表是否具有足夠的測量品質?
需要檢查:
- 題項與構念的內容是否相符
- 題項之間是否具有合理一致性
- 是否存在多個不同因素
- 信度與效度是否可接受
- 分數是否出現嚴重天花板或地板效應
(四)資料分布是否過度集中或偏斜?
即使量表由多題組成,如果絕大多數受訪者都選擇最高分,量表分數仍可能嚴重偏斜,而且難以區分不同受訪者。
因此,多題量表只是「較可能」近似連續資料,不是自動轉換成真正的等距尺度。
七、量表為什麼通常使用多個題項?
構念往往是抽象且多面的。
例如,「對藥局選址系統的信任」可能包括:
- 相信資料正確
- 相信計算方式合理
- 相信推薦結果可靠
- 願意依據系統結果作決策
如果只詢問:
我信任這套系統。
受訪者可能對「信任」有不同理解。有人想到資料正確性,有人想到資訊安全,也有人想到是否願意採納推薦。
使用多個題項,可以從不同角度涵蓋同一構念,提高測量內容的完整性。
但題目也不是越多越好。大量措辭相近、內容重複的題項可能使Cronbach’s α非常高,卻不代表量表真的測得更完整。題目過多也可能造成受訪者疲勞、機械作答或中途退出。
因此,量表設計的重點是:
使用足夠但不重複的題項,完整而清楚地涵蓋構念內容。
八、量表總分與平均分數有什麼不同?
若所有受訪者都回答相同數量的題目,而且各題使用相同計分範圍,量表總分與平均分數通常只差一個固定倍數。
以前面的四題量表為例:
$$ 總分=16 $$
$$ 平均分數=4 $$
總分除以題數便是平均分數,因此兩者的排序、相關及許多標準化分析結果通常相同。
使用總分的優點
- 能呈現完整分數範圍。
- 某些既有量表已有明確總分與臨界值。
- 便於依照原量表規範解釋。
使用平均分數的優點
- 保留原本量尺的範圍。
- 五點量表的平均分數仍介於1至5分。
- 比較不同題數的構念時較直觀。
例如:
知覺有用性的平均分數為4.12分。
通常比:
知覺有用性總分為16.48分。
更容易理解。
不論採用總分或平均分數,都應事先說明計分方式,並遵循原量表的使用規則。
九、什麼是正向題?
正向題是指構念程度越高,得分也越高的題目。
例如測量「系統信任」:
我相信這套系統提供的選址資訊是可靠的。
若回答選項為:
- 非常不同意=1
- 不同意=2
- 普通=3
- 同意=4
- 非常同意=5
受訪者越同意,代表系統信任程度越高,因此這是一道正向題。
正向題的原始分數通常可以直接納入量表計算。
十、什麼是反向題?
反向題的陳述方向與構念相反。
例如:
我懷疑這套系統提供的選址資訊。
如果「非常同意」仍記為5分,這個高分其實代表較低的系統信任。若直接與正向題相加,分數方向便會互相衝突。
因此,反向題需要重新編碼。
五點量尺的反向計分
| 原始分數 | 反向計分後 |
|---|---|
| 1 | 5 |
| 2 | 4 |
| 3 | 3 |
| 4 | 2 |
| 5 | 1 |
反向計分的通用公式是:
$$ 反向分數=(量尺最高分+量尺最低分)-原始分數 $$
對1至5分量尺而言:
$$ 反向分數=6-原始分數 $$
例如,某位受訪者在反向題選擇5分,反向計分後就是:
$$ 6-5=1 $$
完成反向計分後,高分才會與其他題目一樣,都代表較高的系統信任程度。
十一、反向題不只是按一下「重新編碼」
反向題在理論上可以減少受訪者一路選擇相同答案的傾向,但實務上也可能造成新的問題。
例如:
- 受訪者沒有注意否定詞。
- 題目使用雙重否定。
- 正反題混雜造成理解負擔。
- 反向題因語意方式不同,形成獨立因素。
- 年長者或閱讀能力不同的受訪者更容易誤解。
不良反向題例如:
我不同意這套系統並非沒有幫助。
這種雙重否定很難理解,可能使測量誤差增加。
因此,不應為了讓問卷看起來專業而刻意加入大量反向題。若要使用,應確保句子簡短、語意單一,而且在預試階段確認受訪者能正確理解。
常見錯誤
最常見的錯誤是:
研究者忘記反向計分,就直接進行信度分析或計算量表分數。
這可能造成:
- 題項之間出現負相關。
- Cronbach’s α下降。
- 量表總分失去意義。
- 後續迴歸係數方向錯誤。
因此,進行量表分析前,必須先建立清楚的題項編碼表。
十二、遺漏值是什麼?
遺漏值是受訪者沒有提供有效答案的資料。
常見原因包括:
- 忘記作答
- 不願回答
- 不知道答案
- 題目不適用
- 系統漏記
- 資料輸入錯誤
遺漏值不應自動被視為0。
例如,五點量表的有效分數是1至5。如果以0代表未回答,研究者必須在統計軟體中將0定義為遺漏值。否則,軟體可能把0當成真正分數,導致平均數被錯誤拉低。
十三、量表遇到遺漏值時怎麼辦?
假設一個量表有五題,其中一位受訪者只回答四題。研究者可能採取不同方式:
方法一:完整案例法
只要量表中有一題缺失,就不計算該受訪者的量表分數。
優點是規則簡單,缺點是可能損失大量樣本。如果遺漏並非完全隨機,也可能造成偏誤。
方法二:以已回答題目的平均數計算
例如規定至少完成五題中的四題,就以已回答題目的平均數作為量表分數。
這種方法可以保留部分樣本,但必須:
- 事先設定最低完成題數。
- 確認原量表是否允許如此計分。
- 在研究方法中清楚說明。
不能讓只回答一題的人與回答全部五題的人同樣取得量表平均分數,因為兩者的測量可靠程度不同。
方法三:統計插補
依研究設計與遺漏機制,使用單一插補或多重插補等方法處理。
直接使用整體平均數填補每一個遺漏值雖然簡單,卻會低估資料變異,並扭曲變項間的關聯,因此通常不宜作為正式研究的預設方法。
遺漏值處理的重點
研究者應先回答:
- 遺漏比例有多高?
- 哪些題目最常遺漏?
- 遺漏是否集中在某類受訪者?
- 原量表是否已有計分規定?
- 不同處理方式會不會改變研究結論?
遺漏值不是單純的軟體操作問題,而是可能影響研究有效性的問題。
十四、什麼是天花板效應?
天花板效應是指大量受訪者的分數集中在量表最高端。
例如,一份五點滿意度量表中:
- 70%的受訪者選擇5分。
- 25%的受訪者選擇4分。
- 只有5%選擇1至3分。
此時,大多數人都擠在最高分附近,量表無法有效區分「滿意」與「非常滿意」的人。
就像所有人都碰到天花板,無法再向上表現,因此稱為天花板效應。
天花板效應可能造成的問題
- 無法辨認高分受訪者之間的差異。
- 難以測量後續改善。
- 變異數降低。
- 與其他變項的相關可能被壓低。
- 干預或改善措施看起來沒有成效。
例如,介入前平均分數已達4.9分,即使介入真的有效,量表也幾乎沒有上升空間。
十五、什麼是地板效應?
地板效應與天花板效應相反,是指大量分數集中在量表最低端。
例如,一份「使用困難程度」量表中,大多數人都得到最低分,研究者就難以區分哪些人完全沒有困難,哪些人只有極輕微困難。
地板效應可能造成的問題
- 低分受訪者難以區分。
- 無法偵測狀況進一步下降。
- 分數分布嚴重偏斜。
- 變項之間的關聯可能被低估。
十六、如何發現天花板或地板效應?
研究者可以檢查:
- 每個選項的次數與百分比
- 最低分與最高分的比例
- 平均數是否接近量尺端點
- 中位數與四分位距
- 直方圖
- 箱形圖
- 分數是否具有足夠變異
目前沒有適用於所有領域的單一比例門檻。某些研究會將最低分或最高分比例超過15%視為警訊,但這只能作為參考,仍須依量表用途、研究族群及領域標準判斷。
因此,比起只宣稱「沒有天花板效應」,更好的做法是直接報告最高分與最低分所占比例,讓讀者判斷。
十七、題項必須對應構念
量表設計最重要的原則,不是讓Cronbach’s α越高越好,而是每一道題目都必須與構念定義相符。
例如研究「系統知覺有用性」,理論定義是:
使用者相信該系統能改善工作或決策表現的程度。
那麼合理題項可能包括:
- 系統能提升選址效率。
- 系統能改善選址決策品質。
- 系統能幫助比較候選地點。
- 系統能減少蒐集資料的時間。
但以下題目未必屬於知覺有用性:
- 系統畫面很漂亮。
- 我喜歡藍色介面。
- 我擅長使用電腦。
- 我的藥局營業額很高。
這些題目可能涉及美觀、個人能力或營運績效,不能只因為與其他題目有相關,就納入知覺有用性量表。
十八、為什麼不能只因統計結果漂亮就刪題?
進行信度或因素分析時,研究者可能發現刪除某一道題目後:
- Cronbach’s α上升。
- 因素負荷量變得更整齊。
- 模型適配度提高。
- 構念之間更容易達到區辨效度標準。
但這不代表該題目一定應該刪除。
刪題會改變構念實際涵蓋的內容。若被刪除的題目代表構念的重要面向,量表可能只剩下彼此非常相似的題目,統計數字雖然漂亮,內容卻變得狹窄。
例如,「藥局選址系統的信任」原本包含:
- 資料正確性
- 計算透明度
- 推薦可靠性
- 資訊安全
如果「資訊安全」題項與其他題目相關較低,研究者為提高α值而刪除所有資訊安全題目,最後形成的量表可能只是在測量「對推薦結果的信任」,不再完整代表原先定義的系統信任。
因此,刪題至少要同時考慮:
- 理論上是否屬於構念的重要內容?
- 題目是否翻譯或表達不清?
- 是否為反向題造成的方法效應?
- 是否出現低因素負荷或嚴重交叉負荷?
- 刪除後是否破壞內容效度?
- 刪題決定是否能在其他樣本中重現?
不能只使用「刪除後α值提高」作為唯一理由。
十九、使用既有量表還是自行設計?
使用既有量表
若已有經過驗證且適合研究情境的量表,通常優先考慮使用。
優點包括:
- 已有理論基礎。
- 可與先前研究比較。
- 信度與效度已有初步證據。
- 題項設計通常較成熟。
但不能因為量表曾被使用,就假設它在新的族群、語言與情境中一定有效。研究者仍應重新檢查測量品質。
自行設計量表
如果沒有適合的既有工具,研究者可以自行發展題項,但需要更完整的程序:
- 清楚定義構念。
- 根據理論與文獻建立題庫。
- 邀請專家評估內容。
- 進行認知訪談或預試。
- 修正模糊與重複題目。
- 蒐集正式樣本。
- 檢驗信度、效度及因素結構。
- 使用獨立樣本進一步驗證。
自行編幾道題目後直接計算平均數,不能算是已完成一個可靠且有效的量表。
二十、翻譯國外量表時要注意什麼?
國外量表不能只使用一般翻譯軟體逐字翻譯。研究者應注意語言與文化差異。
常見程序包括:
- 取得量表使用或翻譯授權。
- 由熟悉研究領域與雙語的研究者進行翻譯。
- 進行回譯。
- 比較原文與回譯版本。
- 邀請專家檢查語意與文化適切性。
- 透過認知訪談確認受訪者如何理解題目。
- 進行預試。
- 在正式樣本中重新檢查信度與效度。
即使翻譯文字看起來正確,同一個構念在不同文化、職業或年齡族群中,也可能具有不同理解。
二十一、問卷設計時的實務原則
設計Likert題項時,可以遵循以下原則:
- 每題只測量一件事。
- 避免雙重問題。
- 避免雙重否定。
- 避免過度專業或模糊詞語。
- 避免誘導受訪者選擇特定答案。
- 避免讓所有人都容易同意的空泛陳述。
- 題目必須明確對應構念定義。
- 相同量表最好使用一致的回答選項。
- 正向題與反向題都要先確認受訪者能否理解。
- 正式調查前必須進行預試。
不良題目例如:
這套系統容易使用,而且提供的資料非常準確。
這道題同時詢問「易用性」與「資料準確性」。如果受訪者認為系統容易使用,但資料不準確,就不知道應該選擇同意還是不同意。
較好的方式是拆成兩題:
我認為這套系統容易使用。
我認為這套系統提供的資料是準確的。
二十二、論文中應如何說明Likert量表?
研究方法章不應只寫:
本研究採用五點Likert量表。
這樣的資訊不足以讓讀者理解測量方式。
較完整的說明應包括:
- 構念名稱及理論定義
- 量表來源
- 題項數量
- 回答選項
- 高分代表的意義
- 是否包含反向題
- 翻譯或修改程序
- 加總或平均方式
- 遺漏值處理規則
- 信度與效度評估方式
例如:
本研究以四個題項測量知覺有用性,題項改編自既有研究,並依藥局選址情境調整文字。各題採五點Likert量尺,從1分「非常不同意」至5分「非常同意」。四題均為正向計分,得分越高表示受訪者認為系統越能改善選址決策。本研究以各題平均值形成構念分數;若受訪者完成至少三題,則以已完成題目的平均值計算,否則將該構念分數視為遺漏。正式分析前另評估量表的信度與效度。
如果改編幅度很大,就不能只引用原量表的信效度數字,還應在目前樣本中重新驗證。
二十三、常見錯誤整理
Likert量表研究常見的錯誤包括:
- 把單一題項與多題量表混為一談。
- 認為輸入成1至5分後就一定是連續變項。
- 將測量不同構念的題目直接加總。
- 忘記處理反向題。
- 把遺漏值編碼為0並納入平均。
- 沒有說明量表分數如何形成。
- 只報Cronbach’s α,不檢查量表內容與結構。
- 為提高α值而任意刪題。
- 直接引用原研究的信度,未檢驗目前樣本。
- 翻譯或大幅修改量表後,仍宣稱使用的是原量表。
- 忽略天花板與地板效應。
- 用單一道題目測量複雜構念,卻未說明限制。
二十四、本節重點
Likert題項與Likert量表並不相同。
- 單一Likert題項通常屬於次序資料。
- 多個題項可以共同形成一個量表。
- 多題量表的總分或平均分數,研究中常近似視為連續變項。
- 這種處理必須建立在清楚的理論、合理的題項設計及適當的測量品質上。
- 正向題與反向題的計分方向必須一致。
- 遺漏值不能直接當成0分。
- 天花板與地板效應會降低量表區分受訪者的能力。
- 刪除題項必須同時考慮理論與統計證據,不能只追求漂亮的指標。
最重要的是:
量表不是把幾道1至5分的問題加在一起就完成了。研究者必須先說清楚要測量什麼,再證明這些題項確實能合理地共同代表該構念。
下一節將進一步回答:
當數個題項形成量表後,我們如何判斷這些題目的測量結果是否具有足夠的一致性與穩定性?
留言
點擊「載入留言」後顯示 Disqus。