第二章第一節Likert題項與量表:從一個選項到一個可分析的構念

第二章第一節Likert題項與量表:從一個選項到一個可分析的構念


2.1 Likert題項與量表:從一個選項到一個可分析的構念

在管理學、教育、心理學及資訊系統研究中,許多重要概念無法直接用尺或儀器測量。

例如:

  • 使用者滿意度
  • 購買意願
  • 科技接受度
  • 知覺有用性
  • 工作壓力
  • 創業意願
  • 對藥局選址系統的信任程度

這些概念不能像年齡、距離或收入一樣直接取得客觀數值。研究者通常需要設計數個陳述句,請受訪者表達同意程度,再以這些回答推估背後的抽象概念。

這種抽象且無法直接觀察的概念,通常稱為「構念」;用來測量構念的具體問題,則稱為「題項」。

Likert題項便是測量這類態度、認知與意向時最常使用的方法之一。


一、什麼是Likert題項?

Likert題項通常提供一個陳述句,再請受訪者從具有順序的選項中選擇最符合自身狀況的答案。

例如,研究者想了解藥師對藥局選址系統的知覺有用性,可以設計以下題目:

我認為這套系統能提升藥局選址的效率。

回答選項可能是:

  1. 非常不同意
  2. 不同意
  3. 普通
  4. 同意
  5. 非常同意

這一個陳述句就是一個Likert題項。

它具有兩個主要特徵:

  1. 題目通常是一個態度或認知陳述。
  2. 回答選項具有明確順序。

Likert題項不一定只能使用五個選項,也可能使用:

  • 四點量尺
  • 五點量尺
  • 六點量尺
  • 七點量尺

最常見的是五點及七點量尺。


二、Likert題項與Likert量表不是同一件事

這是研究中很常被混用的兩個概念。

(一)Likert題項

單一Likert題項是指一道問題。

例如:

我認為這套系統提供的資訊值得信任。

受訪者從1至5分中選擇一個答案。這只是單一題項,可能只反映受訪者對某一個具體陳述的回答。

(二)Likert量表

Likert量表通常由數個用來測量同一構念的題項組成,再將這些題目的分數加總或取平均。

例如,「知覺有用性」可能包含四個題項:

  1. 這套系統能提升我的選址效率。
  2. 這套系統能幫助我比較不同候選地點。
  3. 這套系統能降低蒐集商圈資料的時間。
  4. 這套系統提供的資訊有助於選址決策。

如果四題都使用1至5分作答,研究者可以計算:

$$量表總分=X_1+X_2+X_3+X_4$$

也可以計算:

$$ 量表平均分數= \frac{X_1+X_2+X_3+X_4}{4} $$

假設某位受訪者的回答分別是4、5、4、3,則:

$$ 總分=4+5+4+3=16 $$

$$ 平均分數=\frac{16}{4}=4 $$

這個4分不再只是某一題的回答,而是由四個題項共同形成的「知覺有用性」量表分數。

因此:

一個題目是Likert題項;數個測量相同構念的題項組合起來,才形成Likert量表。


三、單一Likert題項為什麼通常是次序資料?

單一Likert題項的回答具有大小順序。

以五點量尺為例:

$$ 非常不同意 < 不同意 < 普通 < 同意 < 非常同意 $$

我們知道「非常同意」的同意程度高於「同意」,而「同意」又高於「普通」。

但問題是,相鄰選項之間的心理距離未必相等。

例如:

  • 「非常不同意」與「不同意」之間的差距,是否等於「普通」與「同意」之間的差距?
  • 從1分提高到2分,是否與從4分提高到5分具有相同意義?

研究者通常無法直接證明這些心理距離完全相等。

因此,單一Likert題項在測量理論上通常被視為次序資料,而不是嚴格的等距資料。

數字只是編碼

將回答選項編成1、2、3、4、5,並不會自動使它變成連續變項。

數字在這裡首先代表的是回答順序:

  • 1代表非常不同意
  • 2代表不同意
  • 3代表普通
  • 4代表同意
  • 5代表非常同意

不能因為答案被輸入成數字,就忽略它原本是具有順序的類別資料。


四、單一題項能不能計算平均數?

從嚴格的測量尺度觀點來看,單一Likert題項是次序資料,比較適合報告:

  • 各選項的次數
  • 各選項的百分比
  • 中位數
  • 四分位距

例如:

在200位受訪藥師中,18%選擇非常不同意、22%選擇不同意、20%選擇普通、30%選擇同意,另有10%選擇非常同意。

這種呈現方式保留了各回答類別的完整分布。

實務研究中,研究者也常計算單一題項的平均數,例如報告平均滿意度為3.42分。這種做法相當普遍,但實際上隱含了一項假設:

研究者將1至5分之間的距離近似視為相等。

在樣本數適當、回答選項有五點以上,而且分布不過度偏斜時,某些統計方法對這種近似處理可能具有一定穩健性。不過,研究者不應把「實務上經常這樣做」誤認為「單一Likert題項本來就是連續資料」。

因此,較審慎的做法是:

  • 若重點是描述單一題目的回答,優先報告次數與百分比。
  • 若報告平均數,最好同時呈現回答分布。
  • 若正式推論高度依賴單一題項,應考慮次序資料的分析方法。
  • 不要僅因統計軟體能計算平均數,就認定這種處理必然合理。

五、多個Likert題項為什麼常近似視為連續變項?

當數個題項共同測量同一個構念,並加總或取平均形成量表分數時,可取得的分數範圍會增加。

例如,五個題項都採1至5分:

  • 最低總分為5分。
  • 最高總分為25分。
  • 中間可能出現許多不同的分數。

相較於單一題項只有五個選項,多題量表的總分通常更接近連續分布。

此外,一個抽象構念往往具有多個面向,單一題目容易受到:

  • 題目措辭
  • 當下情緒
  • 個人理解
  • 特定情境
  • 隨機回答誤差

等因素影響。

使用多個題項,可以讓不同題目的測量誤差在某種程度上互相平衡,使量表分數比單一題項更穩定。

因此,管理學與社會科學研究經常將多題Likert量表的加總分數或平均分數近似視為連續變項,並使用:

  • 平均數與標準差
  • t檢定
  • ANOVA
  • Pearson相關
  • 線性迴歸
  • 結構方程模型

但這種做法不是無條件成立。


六、多題量表可以視為連續變項的條件

多個Likert題項加總後,不代表一定可以合理地當作連續變項。至少需要考慮以下問題。

(一)題項是否測量同一個構念?

如果幾道題目測量的是不同概念,就不能只因為都使用1至5分,便把它們加總。

例如:

  1. 我認為系統操作很容易。
  2. 我認為系統資料很可靠。
  3. 我願意付費購買這套系統。
  4. 我所在藥局的營業額很高。

這四題分別涉及:

  • 易用性
  • 信任
  • 付費意願
  • 經營績效

它們並不是同一構念,直接加總成一個總分沒有清楚的理論意義。

題項能否組成量表,首先應由理論和量表設計決定,之後才透過信度與因素分析提供經驗證據。

(二)題項的計分方向是否一致?

如果高分在某些題目代表正向態度,在另一些題目代表負向態度,就必須先處理反向題,才能計算總分或平均分數。

(三)量表是否具有足夠的測量品質?

需要檢查:

  • 題項與構念的內容是否相符
  • 題項之間是否具有合理一致性
  • 是否存在多個不同因素
  • 信度與效度是否可接受
  • 分數是否出現嚴重天花板或地板效應

(四)資料分布是否過度集中或偏斜?

即使量表由多題組成,如果絕大多數受訪者都選擇最高分,量表分數仍可能嚴重偏斜,而且難以區分不同受訪者。

因此,多題量表只是「較可能」近似連續資料,不是自動轉換成真正的等距尺度。


七、量表為什麼通常使用多個題項?

構念往往是抽象且多面的。

例如,「對藥局選址系統的信任」可能包括:

  • 相信資料正確
  • 相信計算方式合理
  • 相信推薦結果可靠
  • 願意依據系統結果作決策

如果只詢問:

我信任這套系統。

受訪者可能對「信任」有不同理解。有人想到資料正確性,有人想到資訊安全,也有人想到是否願意採納推薦。

使用多個題項,可以從不同角度涵蓋同一構念,提高測量內容的完整性。

但題目也不是越多越好。大量措辭相近、內容重複的題項可能使Cronbach’s α非常高,卻不代表量表真的測得更完整。題目過多也可能造成受訪者疲勞、機械作答或中途退出。

因此,量表設計的重點是:

使用足夠但不重複的題項,完整而清楚地涵蓋構念內容。


八、量表總分與平均分數有什麼不同?

若所有受訪者都回答相同數量的題目,而且各題使用相同計分範圍,量表總分與平均分數通常只差一個固定倍數。

以前面的四題量表為例:

$$ 總分=16 $$

$$ 平均分數=4 $$

總分除以題數便是平均分數,因此兩者的排序、相關及許多標準化分析結果通常相同。

使用總分的優點

  • 能呈現完整分數範圍。
  • 某些既有量表已有明確總分與臨界值。
  • 便於依照原量表規範解釋。

使用平均分數的優點

  • 保留原本量尺的範圍。
  • 五點量表的平均分數仍介於1至5分。
  • 比較不同題數的構念時較直觀。

例如:

知覺有用性的平均分數為4.12分。

通常比:

知覺有用性總分為16.48分。

更容易理解。

不論採用總分或平均分數,都應事先說明計分方式,並遵循原量表的使用規則。


九、什麼是正向題?

正向題是指構念程度越高,得分也越高的題目。

例如測量「系統信任」:

我相信這套系統提供的選址資訊是可靠的。

若回答選項為:

  • 非常不同意=1
  • 不同意=2
  • 普通=3
  • 同意=4
  • 非常同意=5

受訪者越同意,代表系統信任程度越高,因此這是一道正向題。

正向題的原始分數通常可以直接納入量表計算。


十、什麼是反向題?

反向題的陳述方向與構念相反。

例如:

我懷疑這套系統提供的選址資訊。

如果「非常同意」仍記為5分,這個高分其實代表較低的系統信任。若直接與正向題相加,分數方向便會互相衝突。

因此,反向題需要重新編碼。

五點量尺的反向計分

原始分數反向計分後
15
24
33
42
51

反向計分的通用公式是:

$$ 反向分數=(量尺最高分+量尺最低分)-原始分數 $$

對1至5分量尺而言:

$$ 反向分數=6-原始分數 $$

例如,某位受訪者在反向題選擇5分,反向計分後就是:

$$ 6-5=1 $$

完成反向計分後,高分才會與其他題目一樣,都代表較高的系統信任程度。


十一、反向題不只是按一下「重新編碼」

反向題在理論上可以減少受訪者一路選擇相同答案的傾向,但實務上也可能造成新的問題。

例如:

  • 受訪者沒有注意否定詞。
  • 題目使用雙重否定。
  • 正反題混雜造成理解負擔。
  • 反向題因語意方式不同,形成獨立因素。
  • 年長者或閱讀能力不同的受訪者更容易誤解。

不良反向題例如:

我不同意這套系統並非沒有幫助。

這種雙重否定很難理解,可能使測量誤差增加。

因此,不應為了讓問卷看起來專業而刻意加入大量反向題。若要使用,應確保句子簡短、語意單一,而且在預試階段確認受訪者能正確理解。

常見錯誤

最常見的錯誤是:

研究者忘記反向計分,就直接進行信度分析或計算量表分數。

這可能造成:

  • 題項之間出現負相關。
  • Cronbach’s α下降。
  • 量表總分失去意義。
  • 後續迴歸係數方向錯誤。

因此,進行量表分析前,必須先建立清楚的題項編碼表。


十二、遺漏值是什麼?

遺漏值是受訪者沒有提供有效答案的資料。

常見原因包括:

  • 忘記作答
  • 不願回答
  • 不知道答案
  • 題目不適用
  • 系統漏記
  • 資料輸入錯誤

遺漏值不應自動被視為0。

例如,五點量表的有效分數是1至5。如果以0代表未回答,研究者必須在統計軟體中將0定義為遺漏值。否則,軟體可能把0當成真正分數,導致平均數被錯誤拉低。


十三、量表遇到遺漏值時怎麼辦?

假設一個量表有五題,其中一位受訪者只回答四題。研究者可能採取不同方式:

方法一:完整案例法

只要量表中有一題缺失,就不計算該受訪者的量表分數。

優點是規則簡單,缺點是可能損失大量樣本。如果遺漏並非完全隨機,也可能造成偏誤。

方法二:以已回答題目的平均數計算

例如規定至少完成五題中的四題,就以已回答題目的平均數作為量表分數。

這種方法可以保留部分樣本,但必須:

  • 事先設定最低完成題數。
  • 確認原量表是否允許如此計分。
  • 在研究方法中清楚說明。

不能讓只回答一題的人與回答全部五題的人同樣取得量表平均分數,因為兩者的測量可靠程度不同。

方法三:統計插補

依研究設計與遺漏機制,使用單一插補或多重插補等方法處理。

直接使用整體平均數填補每一個遺漏值雖然簡單,卻會低估資料變異,並扭曲變項間的關聯,因此通常不宜作為正式研究的預設方法。

遺漏值處理的重點

研究者應先回答:

  1. 遺漏比例有多高?
  2. 哪些題目最常遺漏?
  3. 遺漏是否集中在某類受訪者?
  4. 原量表是否已有計分規定?
  5. 不同處理方式會不會改變研究結論?

遺漏值不是單純的軟體操作問題,而是可能影響研究有效性的問題。


十四、什麼是天花板效應?

天花板效應是指大量受訪者的分數集中在量表最高端。

例如,一份五點滿意度量表中:

  • 70%的受訪者選擇5分。
  • 25%的受訪者選擇4分。
  • 只有5%選擇1至3分。

此時,大多數人都擠在最高分附近,量表無法有效區分「滿意」與「非常滿意」的人。

就像所有人都碰到天花板,無法再向上表現,因此稱為天花板效應。

天花板效應可能造成的問題

  • 無法辨認高分受訪者之間的差異。
  • 難以測量後續改善。
  • 變異數降低。
  • 與其他變項的相關可能被壓低。
  • 干預或改善措施看起來沒有成效。

例如,介入前平均分數已達4.9分,即使介入真的有效,量表也幾乎沒有上升空間。


十五、什麼是地板效應?

地板效應與天花板效應相反,是指大量分數集中在量表最低端。

例如,一份「使用困難程度」量表中,大多數人都得到最低分,研究者就難以區分哪些人完全沒有困難,哪些人只有極輕微困難。

地板效應可能造成的問題

  • 低分受訪者難以區分。
  • 無法偵測狀況進一步下降。
  • 分數分布嚴重偏斜。
  • 變項之間的關聯可能被低估。

十六、如何發現天花板或地板效應?

研究者可以檢查:

  • 每個選項的次數與百分比
  • 最低分與最高分的比例
  • 平均數是否接近量尺端點
  • 中位數與四分位距
  • 直方圖
  • 箱形圖
  • 分數是否具有足夠變異

目前沒有適用於所有領域的單一比例門檻。某些研究會將最低分或最高分比例超過15%視為警訊,但這只能作為參考,仍須依量表用途、研究族群及領域標準判斷。

因此,比起只宣稱「沒有天花板效應」,更好的做法是直接報告最高分與最低分所占比例,讓讀者判斷。


十七、題項必須對應構念

量表設計最重要的原則,不是讓Cronbach’s α越高越好,而是每一道題目都必須與構念定義相符。

例如研究「系統知覺有用性」,理論定義是:

使用者相信該系統能改善工作或決策表現的程度。

那麼合理題項可能包括:

  • 系統能提升選址效率。
  • 系統能改善選址決策品質。
  • 系統能幫助比較候選地點。
  • 系統能減少蒐集資料的時間。

但以下題目未必屬於知覺有用性:

  • 系統畫面很漂亮。
  • 我喜歡藍色介面。
  • 我擅長使用電腦。
  • 我的藥局營業額很高。

這些題目可能涉及美觀、個人能力或營運績效,不能只因為與其他題目有相關,就納入知覺有用性量表。


十八、為什麼不能只因統計結果漂亮就刪題?

進行信度或因素分析時,研究者可能發現刪除某一道題目後:

  • Cronbach’s α上升。
  • 因素負荷量變得更整齊。
  • 模型適配度提高。
  • 構念之間更容易達到區辨效度標準。

但這不代表該題目一定應該刪除。

刪題會改變構念實際涵蓋的內容。若被刪除的題目代表構念的重要面向,量表可能只剩下彼此非常相似的題目,統計數字雖然漂亮,內容卻變得狹窄。

例如,「藥局選址系統的信任」原本包含:

  • 資料正確性
  • 計算透明度
  • 推薦可靠性
  • 資訊安全

如果「資訊安全」題項與其他題目相關較低,研究者為提高α值而刪除所有資訊安全題目,最後形成的量表可能只是在測量「對推薦結果的信任」,不再完整代表原先定義的系統信任。

因此,刪題至少要同時考慮:

  1. 理論上是否屬於構念的重要內容?
  2. 題目是否翻譯或表達不清?
  3. 是否為反向題造成的方法效應?
  4. 是否出現低因素負荷或嚴重交叉負荷?
  5. 刪除後是否破壞內容效度?
  6. 刪題決定是否能在其他樣本中重現?

不能只使用「刪除後α值提高」作為唯一理由。


十九、使用既有量表還是自行設計?

使用既有量表

若已有經過驗證且適合研究情境的量表,通常優先考慮使用。

優點包括:

  • 已有理論基礎。
  • 可與先前研究比較。
  • 信度與效度已有初步證據。
  • 題項設計通常較成熟。

但不能因為量表曾被使用,就假設它在新的族群、語言與情境中一定有效。研究者仍應重新檢查測量品質。

自行設計量表

如果沒有適合的既有工具,研究者可以自行發展題項,但需要更完整的程序:

  1. 清楚定義構念。
  2. 根據理論與文獻建立題庫。
  3. 邀請專家評估內容。
  4. 進行認知訪談或預試。
  5. 修正模糊與重複題目。
  6. 蒐集正式樣本。
  7. 檢驗信度、效度及因素結構。
  8. 使用獨立樣本進一步驗證。

自行編幾道題目後直接計算平均數,不能算是已完成一個可靠且有效的量表。


二十、翻譯國外量表時要注意什麼?

國外量表不能只使用一般翻譯軟體逐字翻譯。研究者應注意語言與文化差異。

常見程序包括:

  1. 取得量表使用或翻譯授權。
  2. 由熟悉研究領域與雙語的研究者進行翻譯。
  3. 進行回譯。
  4. 比較原文與回譯版本。
  5. 邀請專家檢查語意與文化適切性。
  6. 透過認知訪談確認受訪者如何理解題目。
  7. 進行預試。
  8. 在正式樣本中重新檢查信度與效度。

即使翻譯文字看起來正確,同一個構念在不同文化、職業或年齡族群中,也可能具有不同理解。


二十一、問卷設計時的實務原則

設計Likert題項時,可以遵循以下原則:

  • 每題只測量一件事。
  • 避免雙重問題。
  • 避免雙重否定。
  • 避免過度專業或模糊詞語。
  • 避免誘導受訪者選擇特定答案。
  • 避免讓所有人都容易同意的空泛陳述。
  • 題目必須明確對應構念定義。
  • 相同量表最好使用一致的回答選項。
  • 正向題與反向題都要先確認受訪者能否理解。
  • 正式調查前必須進行預試。

不良題目例如:

這套系統容易使用,而且提供的資料非常準確。

這道題同時詢問「易用性」與「資料準確性」。如果受訪者認為系統容易使用,但資料不準確,就不知道應該選擇同意還是不同意。

較好的方式是拆成兩題:

我認為這套系統容易使用。

我認為這套系統提供的資料是準確的。


二十二、論文中應如何說明Likert量表?

研究方法章不應只寫:

本研究採用五點Likert量表。

這樣的資訊不足以讓讀者理解測量方式。

較完整的說明應包括:

  • 構念名稱及理論定義
  • 量表來源
  • 題項數量
  • 回答選項
  • 高分代表的意義
  • 是否包含反向題
  • 翻譯或修改程序
  • 加總或平均方式
  • 遺漏值處理規則
  • 信度與效度評估方式

例如:

本研究以四個題項測量知覺有用性,題項改編自既有研究,並依藥局選址情境調整文字。各題採五點Likert量尺,從1分「非常不同意」至5分「非常同意」。四題均為正向計分,得分越高表示受訪者認為系統越能改善選址決策。本研究以各題平均值形成構念分數;若受訪者完成至少三題,則以已完成題目的平均值計算,否則將該構念分數視為遺漏。正式分析前另評估量表的信度與效度。

如果改編幅度很大,就不能只引用原量表的信效度數字,還應在目前樣本中重新驗證。


二十三、常見錯誤整理

Likert量表研究常見的錯誤包括:

  1. 把單一題項與多題量表混為一談。
  2. 認為輸入成1至5分後就一定是連續變項。
  3. 將測量不同構念的題目直接加總。
  4. 忘記處理反向題。
  5. 把遺漏值編碼為0並納入平均。
  6. 沒有說明量表分數如何形成。
  7. 只報Cronbach’s α,不檢查量表內容與結構。
  8. 為提高α值而任意刪題。
  9. 直接引用原研究的信度,未檢驗目前樣本。
  10. 翻譯或大幅修改量表後,仍宣稱使用的是原量表。
  11. 忽略天花板與地板效應。
  12. 用單一道題目測量複雜構念,卻未說明限制。

二十四、本節重點

Likert題項與Likert量表並不相同。

  • 單一Likert題項通常屬於次序資料。
  • 多個題項可以共同形成一個量表。
  • 多題量表的總分或平均分數,研究中常近似視為連續變項。
  • 這種處理必須建立在清楚的理論、合理的題項設計及適當的測量品質上。
  • 正向題與反向題的計分方向必須一致。
  • 遺漏值不能直接當成0分。
  • 天花板與地板效應會降低量表區分受訪者的能力。
  • 刪除題項必須同時考慮理論與統計證據,不能只追求漂亮的指標。

最重要的是:

量表不是把幾道1至5分的問題加在一起就完成了。研究者必須先說清楚要測量什麼,再證明這些題項確實能合理地共同代表該構念。

下一節將進一步回答:

當數個題項形成量表後,我們如何判斷這些題目的測量結果是否具有足夠的一致性與穩定性?

留言

點擊「載入留言」後顯示 Disqus。