研究所會用到的統計知識第一章
第一課:認識變項類型——為什麼它會決定統計方法?
學習統計時,第一個需要掌握的概念不是公式,而是「變項」。
在一篇實證論文中,研究者通常會蒐集受試者、地區、企業或其他研究對象的各種資料。例如,研究藥局選址時,可能蒐集藥局所在區域、周邊人口數、附近診所數、店面租金、店面距離,以及某個地點是否已經設有藥局。這些會隨研究對象而改變的特徵,都可以稱為變項。
然而,變項所代表的資料性質並不完全相同。例如「所在地區」與「店面租金」雖然都能輸入統計軟體,卻不能使用完全相同的方式進行計算。因此,在開始分析之前,必須先辨認變項的類型。
一、什麼是變項?
變項是指在不同研究對象之間可能具有不同數值或類別的特徵。
例如,研究者調查不同藥局時,可能取得下列資料:
- 藥局所在縣市
- 藥局的經營型態
- 店面坪數
- 每月租金
- 周邊人口數
- 與最近診所的距離
- 是否提供慢性病連續處方箋服務
- 經營者對商圈的滿意程度
這些資料都屬於變項。相對地,如果所有受調查藥局都位於台灣,那麼「研究國家」在這份資料中只有一種狀態,沒有產生變化,通常不會作為主要的分析變項。
辨認變項時,不能只看資料在電腦中以文字還是數字呈現,而要判斷數值背後真正代表的意義。
例如,可以將藥局所在地區編碼為:
- 北部=1
- 中部=2
- 南部=3
- 東部=4
雖然這些地區被編成數字,但數字只是一種標記。不能因為南部編碼為3、北部編碼為1,就說南部是北部的三倍,也不能計算四個地區的平均值。因此,「地區」仍然是類別變項。
二、類別變項
類別變項是用來區分研究對象所屬類別的變項。這些類別通常沒有固定的大小或高低順序,因此也稱為名目變項。
常見例子包括:
- 性別
- 居住地區
- 婚姻狀態
- 藥局經營型態
- 是否開設藥局
- 是否使用某項資訊系統
以「是否開設藥局」為例,資料可以編碼為:
- 未開設=0
- 已開設=1
這裡的0與1只是代表兩種不同狀態,並不是一般數學上的數量。不能說「已開設」比「未開設」多一個單位,也不能把這兩個數字直接當成連續測量值理解。
描述類別變項時,通常使用次數及百分比。例如:
受調查的200個候選地點中,有80個地點已設有藥局,占40%;另外120個地點未設有藥局,占60%。
當研究者想知道兩個類別變項是否有關聯時,常使用卡方檢定。例如:
都市與非都市地區的藥局設置比例是否不同?
其中:
- 地區類型是類別變項。
- 是否設有藥局也是類別變項。
- 因此,可考慮使用卡方檢定分析兩者之間的關聯。
如果研究目標是根據多項因素預測「是否設有藥局」,則因為結果只有「是」與「否」兩種狀態,可以考慮使用二元邏輯斯迴歸。
三、次序變項
次序變項也是一種類別資料,但各類別之間具有順序。
常見例子包括:
- 教育程度
- 滿意度等級
- 疼痛程度
- 收入級距
- 服務品質評等
- 商圈發展程度
例如,研究者詢問藥師對候選地點的滿意度,回答選項為:
- 非常不滿意
- 不滿意
- 普通
- 滿意
- 非常滿意
我們可以確定「非常滿意」高於「滿意」,「滿意」又高於「普通」。但是,我們無法確定「非常不滿意」到「不滿意」之間的心理距離,是否與「滿意」到「非常滿意」之間的距離完全相等。
因此,單一滿意度題目雖然使用1至5分表示,原則上仍屬於次序變項。
描述次序變項時,可以使用次數、百分比、中位數或四分位距。進行兩個次序變項之間的關聯分析時,可以考慮使用 Spearman 等級相關。
但是,在管理學及社會科學研究中,研究者經常使用多個 Likert 題項測量同一個抽象概念。例如,用五道題目測量「資訊系統使用意願」,再將五題加總或取平均,形成一個量表總分。
這類多題形成的量表分數,在符合適當測量條件時,經常被近似視為連續變項,進而使用平均數、標準差、t檢定或迴歸分析。不過,研究者仍應檢查量表的信度、效度與分布,不能因為軟體產生了一個平均分數,就直接認定它一定適合所有參數統計方法。
四、連續變項
連續變項是數值型變項的一種,理論上可以在某個範圍內取得許多可能的數值。
例如:
- 年齡
- 身高
- 體重
- 店面坪數
- 每月租金
- 與最近診所的距離
- 到達醫院所需時間
距離可能是500公尺,也可能是500.5公尺;租金可能是每月30,000元,也可能是30,500元。這些數值不只具有大小順序,數值之間的差距也具有實際意義。
描述連續變項時,通常使用:
- 平均數
- 標準差
- 中位數
- 四分位距
- 最小值與最大值
要選擇哪一組指標,還要看資料分布。
例如,若大部分藥局月租介於30,000元至60,000元,但少數位於精華地段的店面月租高達300,000元,這些極端值會把平均租金拉高。此時,中位數與四分位距可能比平均數與標準差更能呈現典型店面的租金狀況。
五、等距尺度與比率尺度不能混為一談
初學教材有時會將年齡、收入、距離及量表總分都簡化稱為「連續/等距變項」。這種分類方便入門,但嚴格來說並不完全精確。
等距尺度具有相等的數值間距,但沒有真正的零點。最常見的例子是攝氏溫度。20°C與10°C相差10°C,30°C與20°C也相差10°C,因此差距可以比較。但是,0°C不代表完全沒有溫度,所以不能說20°C是10°C的兩倍熱。
比率尺度除了具有相等間距,也具有真正的零點。常見例子包括:
- 年齡
- 收入
- 距離
- 重量
- 店面坪數
- 周邊人口數
距離0公尺表示沒有距離,因此1,000公尺確實是500公尺的兩倍。收入0元也具有「沒有收入」的實際意義。
量表總分則比較特殊。它通常由多個次序題項加總或平均而來,研究實務上經常近似當作連續變項使用,但不能因此認定它在測量理論上必然具有真正的等距性。
因此,更精確的分類方式是:
- 年齡、收入與距離:通常屬於比率尺度。
- 攝氏溫度:屬於等距尺度。
- 單一滿意度題目:通常屬於次序尺度。
- 多題量表的總分或平均分數:研究實務中常近似視為連續變項,但須視量表品質、分布及分析目的判斷。
六、變項類型為什麼會決定統計方法?
不同的統計方法對資料具有不同要求。因此,選擇分析方法時,首先要看研究問題,其次要看自變項與依變項的類型。
以下是幾個常見例子:
| 研究問題 | 自變項 | 依變項 | 可考慮的方法 |
|---|---|---|---|
| 不同地區的藥局設置比例是否不同? | 地區:類別變項 | 是否設置:類別變項 | 卡方檢定 |
| 都市與非都市地區的平均租金是否不同? | 城鄉類型:二分類變項 | 租金:連續變項 | 獨立樣本t檢定 |
| 三種經營型態的平均營業額是否不同? | 經營型態:三組類別變項 | 營業額:連續變項 | 單因子ANOVA |
| 人口數與藥局數量是否相關? | 人口數:數值變項 | 藥局數:計數變項 | 相關分析或計數迴歸,視目的而定 |
| 距離診所的遠近能否預測是否設有藥局? | 距離:連續變項 | 是否設置:二分類變項 | 二元邏輯斯迴歸 |
| 租金與坪數能否預測藥局營業額? | 租金、坪數:連續變項 | 營業額:連續變項 | 線性迴歸 |
這張表只能作為初步判斷,不能取代完整的方法檢查。即使變項類型相符,仍須考慮樣本是否獨立、資料分布、離群值、樣本數、研究設計及模型假設。
例如,以人口數與藥局數量為例,藥局數量是不能出現小數且通常包含許多零值的計數資料。若研究目的只是初步了解兩者關聯,可以先畫散佈圖並計算相關係數;但若要建立正式模型,Poisson迴歸或負二項迴歸可能比一般線性迴歸更適合。
這表示選擇方法不能只靠「套表格」,還要理解資料如何產生。
七、同一個概念可能被測量成不同變項類型
變項類型不是由研究概念的名稱決定,而是由實際測量方式決定。
例如,「收入」可以有不同的測量方式:
- 詢問每月收入金額:比率尺度。
- 將收入分成低、中、高三組:次序尺度。
- 詢問是否達到某收入門檻:二分類變項。
「地區」也可以有不同表示方式:
- 北部、中部、南部、東部:名目變項。
- 都市、郊區、鄉村:若只是地區分類,通常視為類別變項。
- 都市化程度1至5級:次序變項。
- 每平方公里人口數:比率尺度。
研究者如果把原本精確的連續資料任意切成「高、中、低」三組,可能會損失資訊,降低統計檢定力,也可能因切點不同而得到不同結果。因此,除非有明確理論、政策門檻或臨床標準,通常不宜只為了分析方便而隨意將連續變項分類。
八、變項還可以依研究角色分類
除了按照測量尺度分類,變項也可以按照它在研究模型中的角色分類。
(一)自變項
自變項是研究者用來解釋或預測結果的變項。
例如:
周邊人口數是否與藥局設置機率有關?
在這個問題中,周邊人口數是自變項。
(二)依變項
依變項是研究者想要解釋或預測的結果。
在上述問題中,「是否設有藥局」就是依變項。
(三)控制變項
控制變項是為了減少其他因素干擾而納入分析的變項。
例如,分析人口數與藥局設置的關聯時,可能控制:
- 都市化程度
- 老年人口比例
- 附近診所數量
- 店面租金
- 交通便利性
但是,控制變項不能只按照「有資料就全部放入」的方式選擇。錯誤控制中介變項、結果造成的變項或碰撞變項,反而可能產生新的偏誤。因此,控制變項的選擇應以理論、先前文獻與合理的因果架構為依據。
(四)中介變項與調節變項
中介變項用來描述自變項可能透過什麼機制與依變項產生關聯。
例如:
人口密度提高商圈需求,而商圈需求進一步提高藥局設置機率。
其中,商圈需求可能是中介變項。
調節變項則表示某項關聯會因條件不同而改變。
例如:
診所數量與藥局設置機率的關聯,在都市與鄉村地區可能不同。
此時,城鄉類型可能具有調節作用。
必須注意,中介與調節不是單靠統計顯著就能成立。研究者仍須提出理論依據,並確認研究設計是否足以支持相關解釋。
九、判斷變項類型的簡單步驟
遇到一個變項時,可以按照下列順序判斷:
- 這個變項只是把對象分成不同類別嗎?
- 如果是類別,這些類別有自然順序嗎?
- 如果是數值,相鄰數值的差距是否具有相同意義?
- 數值0是否代表該特徵完全不存在?
- 它在研究中是結果、解釋因素,還是需要控制的條件?
- 研究者實際如何測量與編碼這個變項?
例如,變項「與最近診所的距離」:
- 它以公尺測量。
- 數值可以排序。
- 500公尺與1,000公尺之間的差距具有實際意義。
- 0公尺代表沒有空間距離。
- 因此通常屬於比率尺度的連續變項。
若把距離改成:
- 500公尺以內
- 501至1,000公尺
- 1,000公尺以上
它就被轉換為具有順序的類別變項。概念仍然是距離,但測量與編碼方式已經改變,因此可使用的統計方法也可能不同。
十、本課重點整理
變項是統計分析的基本單位,但變項不能只按照軟體中顯示的是文字或數字來判斷。
最基本的分類包括:
- 類別變項:只有類別差異,沒有自然順序。
- 次序變項:類別具有順序,但級距未必相等。
- 等距尺度:數值差距相等,但沒有真正零點。
- 比率尺度:數值差距相等,而且具有真正零點。
- 連續變項:可以在一定範圍內取得許多可能數值。
此外,變項還可依研究角色分為自變項、依變項、控制變項、中介變項與調節變項。
變項類型確實會影響統計方法的選擇,但它不是唯一條件。完整判斷還必須考慮研究問題、研究設計、資料分布、樣本結構及方法假設。
因此,進行統計分析時,不應先問:
我要使用哪一個統計功能?
而應先問:
我的研究問題是什麼?變項如何測量?資料具有什麼性質?
當這三個問題回答清楚後,統計方法的選擇才會具有合理依據。
課後練習
請判斷下列變項的類型:
- 藥局所在縣市。
- 藥師對選址地點的滿意程度,分為非常不滿意至非常滿意。
- 店面每月租金。
- 是否位於醫院附近。
- 與最近診所的距離。
- 將距離分為近、中、遠三個等級。
- 由六題 Likert 題項平均而成的「開業意願」分數。
參考答案:
- 名目變項。
- 次序變項。
- 比率尺度,通常作為連續變項分析。
- 二分類名目變項。
- 比率尺度,通常為連續變項。
- 次序變項。
- 原始題項是次序資料;多題形成的量表平均分數在符合測量及分析條件時,實務上常近似視為連續變項。
留言
點擊「載入留言」後顯示 Disqus。