十二站
準備
第 1 站 實務研究與護理發展 Research & professional development
先講清楚研究在臨床裡是拿來做什麼的,以及實證實務怎麼長出來。
研究不是把單位的問題修好就算,它要能推論到單位以外。這一站先弄清楚研究、品管、實證實務三者的分工:品管改善這一床這一區的流程,研究產生可以外推的知識,實證實務則是把別人產生的知識用回自己的臨床。想清楚你手上的困擾屬於哪一種,後面十一站才不會走錯路。
關鍵名詞:實證實務 EBP、研究問題、量性/質性
常被問倒的地方:把「做研究」跟「做品管」混在一起講。品管是改善單一單位的流程,研究要能推論到單位以外。
第 2 站 研究問題與假設 Research problem, purpose & hypothesis
把臨床上的困擾,收斂成一句可以被驗證的句子,並指定自變項與依變項。
把一句臨床上的抱怨,收斂成一句可以被資料推翻的句子。這一站要交出三樣東西:研究問題、研究目的、以及每個變項的概念型與操作型定義。判斷做完沒有的標準很簡單——把你的操作型定義交給另一個人,他能不能照著測出同一個東西。
關鍵名詞:research problem、purpose、objective、H₀、自變項、依變項、干擾變項、操作型定義
常被問倒的地方:概念型定義寫得很漂亮,操作型定義卻沒交代「實際上怎麼測、誰來判定」——口委一定從這裡切進來。
第 3 站 文獻查證 Literature review
把已經知道的整理成一張圖,然後指出那塊還空著的地方,就是你的研究缺口。
文獻回顧不是把讀過的文章列出來,而是畫出一張「目前已知的地圖」,然後指出地圖上還空著的那一塊。檢索策略、納入排除條件要寫到別人能重跑一次;讀完之後你要能說出一句話:前人做到哪裡、還缺什麼、所以我要補哪一塊。
關鍵名詞:systematic review、meta-analysis、research gap、MeSH、Boolean、grey literature、risk of bias
常被問倒的地方:文獻寫成流水帳。回顧要收斂到「所以還缺什麼」,不是「有人做過 A、有人做過 B」。
設計
第 4 站 研究設計與概念架構 Research design & conceptual framework
決定要不要給處置、分幾組、量幾次;架構圖要把變項之間的箭頭畫清楚。
決定整個研究長什麼樣:要不要給處置、分幾組、量幾次、什麼時候量。同時把變項之間的關係畫成架構圖,每一個箭頭都要有文獻或理論撐著,不能是自己想的。這一站的產出會直接決定第 12 站能跑哪些統計。
關鍵名詞:conceptual framework、theoretical framework、橫斷式、縱貫式、RCT、quasi-experimental
常被問倒的地方:架構圖畫了箭頭卻沒有理論或文獻支持,等於自己畫的因果。
第 5 站 非實驗性研究設計 Non-experimental design
不給處置、不操控變項,只描述、比較或找關係。診斷準確性研究就住在這一條線上。
不給處置、不操控變項,只描述現況、比較差異或找關係。優點是可行性高、倫理阻力小,代價是講不了因果。診斷準確性研究、橫斷式調查、相關性研究都住在這條線上——寫作時特別小心動詞,沒有操控就不要出現「造成」。
關鍵名詞:descriptive、correlational、cross-sectional、cohort、case-control、retrospective、prospective
常被問倒的地方:相關性研究寫出因果語氣(「造成」「導致」)。沒有操控就只能說關聯。
第 6 站 實驗性研究設計 Experimental design
隨機、操控、控制三個要素齊了才叫真實驗;缺一或缺二就是類實驗。
給了處置,就要回答三個問題:有沒有隨機分派、有沒有操控自變項、情境有沒有受控。三個都齊才叫真實驗,缺一或缺二就是類實驗。臨床上真正做得到三者齊備的很少,重點不是硬撐成真實驗,而是誠實標示設計類型並說明控制了什麼、沒控制什麼。
關鍵名詞:random assignment、manipulation、control、blinding、allocation concealment
常被問倒的地方:寫成「隨機分派」但實際上是照病房、照床號分——那是方便分組,不是隨機。
第 7 站 研究工具的信效度 Reliability & validity of instruments
工具量得穩不穩(信度)、量到的是不是你要的東西(效度),兩件事要分開報。
工具好不好分成兩件事:量得穩不穩(信度)、量到的是不是你要的東西(效度)。這一站要決定用現成量表還是自己發展,並交代每一種信效度的實際數值。最常見的失分是只報 Cronbach's α 就說工具有效——α 屬於信度,跟效度是兩件事。
關鍵名詞:Cronbach's α、test-retest、Cohen's κ、CVI、construct validity、criterion validity
常被問倒的地方:只報 Cronbach's α 就當作「工具有效」。α 是內在一致性,屬於信度,跟效度是兩回事。
執行
第 8 站 抽樣 Sampling
從誰身上收資料、收幾個、怎麼挑;樣本數要用檢定力算出來,不是憑感覺。
決定從誰身上收、收幾個、怎麼挑。樣本數要用 α、檢定力與預期效果量事前算出來,不是憑感覺或憑「以前的論文都收 100 個」。單一院所的方便取樣不是罪,寫清楚並在限制段說明推論邊界才是。
關鍵名詞:population、purposive sampling、convenience sampling、stratified、sample size、power、effect size、attrition
常被問倒的地方:單一院所的方便取樣寫成「具代表性」。該做的是誠實承認,然後在限制段說明推論邊界。
第 9 站 資料收集與處理 Data collection & management
誰、在哪裡、用什麼表單、收到的資料怎麼存與清理,流程要能被別人照著做一遍。
把設計變成實際動作:誰、在哪裡、用什麼表單、收到的資料怎麼存與清理。這一站的判準是可複製性——換一個收案者照著你的流程走,收到的資料應該長得一樣。遺漏值怎麼處理要事前寫死,不能等分析時看結果再決定。
關鍵名詞:研究操作準則、項目負擔、閱讀水準、譯碼簿、先導研究、唯一識別碼、missing data、de-identification
常被問倒的地方:沒寫遺漏值怎麼處理。分析時才臨時決定,會被質疑是看結果挑方法。
第 10 站 研究倫理 Research ethics
知情同意、IRB 審查層級、隱私保護,還有四大原則:自主、不傷害、行善、正義。
知情同意、IRB 審查層級、隱私保護,背後是自主、不傷害、行善、正義四個原則。實務上最花時間的是送審與修正,所以計畫書寫作階段就要同步準備。匿名與保密是兩個不同的詞,送件寫錯會被退。
關鍵名詞:informed consent、IRB、exempt review、expedited review、anonymity、confidentiality、vulnerable population
常被問倒的地方:把匿名與保密當同義詞。匿名是連研究者都對不回是誰,保密是知道但不外洩。
分析與發表
第 11 站 描述性與推論性資料分析 Descriptive & inferential analysis
先描述資料長什麼樣,再用檢定回答問題,最後把 p 值、信賴區間、效果量一起講。
先描述資料長什麼樣,再用檢定回答問題,最後把結果講成人話。報告時 p 值、效果量、95% 信賴區間三個一起給——p 值只說「這個差異不太可能是抽樣誤差」,說不出差異有多大、有沒有臨床意義。
關鍵名詞:descriptive statistics、p-value、95% CI、Type I error、Type II error、chi-square、t-test、ANOVA、regression
常被問倒的地方:只報 p 值。p 小不等於臨床有意義,95% CI 與效果量才看得出幅度。
第 12 站 量性研究寫作與批判・APA 7 Writing, critique & APA 7th
照 IMRAD 把研究寫出來,再用同一套眼光去評別人的文章。
照 IMRAD 把研究寫出來,也用同一套眼光去讀別人的文章。評讀不是挑毛病,是判斷這篇的結論能不能用在你的病人身上。討論段要跟前人文獻對話:一致的說一致,不一致的要給得出解釋,限制要自己先講,不要等口委幫你講。最後兩段——未來研究建議與複製可能性——要跟前面的限制一一對得上:你講了什麼限制,就建議下一個人怎麼補;並且把方法寫到別人照著能重跑一次。
關鍵名詞:IMRAD、APA 7th、critique、信實度、audit trail、reflexivity、intervention fidelity、限制 limitations、replication、preregistration
常被問倒的地方:討論段只重述結果,以及未來建議寫成罐頭句(「建議擴大樣本數」「建議延長追蹤」)。建議要指名道姓地對應自己的限制;複製研究的描述要具體到別人照著能重跑。
研究設計
單組後測設計 One-group posttest-only design
找一群人給處置,結束後量一次。最簡單,也最沒有比較基礎。
例:60 位長青會老人上 8 週太極拳,訓練後測肌耐力與心肺功能。
強在哪:個案數少、流程單純;母群體稀少時可行;沒有前測就沒有測試效應。
弱在哪:沒有對照組,分不出是處置有效還是這群人本來就比較好;沒有前測,成熟或學習的影響去不掉。
雙組後測設計(未隨機) Two-group posttest-only design
有對照組但沒隨機,兩組結束後各量一次。
例:實驗組給穴位按壓、對照組只給常規指導,兩週後比較便祕改善。
強在哪:有比較組;不便做前測、或前測會嚴重干擾結果時適用。
弱在哪:兩組起點是否相同無從得知,基準不同就無法歸因給處置。
單組前、後測設計 One-group pretest-posttest design
同一群人測兩次,中間夾處置,比前後差值。
例:吞嚥訓練護理方案改善巴金森氏病吞嚥障礙的前驅研究,10 位個案前後測。
強在哪:有前後測差異可佐證成效;樣本需求少,可行性高。
弱在哪:沒有對照組,選樣效應去不掉;重複測量會有練習造成的測試效應;結果推不到沒做過前測的人。
隨機化之雙組前、後測設計 Randomized pretest-posttest control group design
隨機分兩組,兩組都測前後測,只有實驗組拿到處置。介入型研究的標準款。
例:社交技巧訓練提升住院精神病患表達與溝通之成效。
強在哪:隨機分派排除選擇效應;前測可確認兩組基準同質;前測效應同時作用在兩組,可互相抵銷。
弱在哪:在自然情境裡很多干擾控制不了;若成熟與霍桑效應無法控制,實質上會退回類實驗。
隨機化之雙組後測設計 Randomized posttest-only control group design
隨機分兩組,都不做前測,只比結束後的結果。
例:穴位按壓對中風病患便祕之成效,以病房為單位隨機分兩組,按壓後兩週收資料。
強在哪:完全避開測試效應;不方便做前測時的首選。
弱在哪:沒有前測就無法驗證兩組起點同質,只能靠隨機化本身。
所羅門氏四組設計 Solomon four-group design
四組交叉:有無前測 × 有無處置,用來把測試效應本身量出來。
例:音樂治療對癌末病患生活品質,120 位均分四組。
強在哪:同時排除選樣效應與測試效應;四組同期進行,時間演進的干擾也一併控制。
弱在哪:要四組人,樣本需求大;統計處理繁瑣。
多因子實驗設計 Factorial design
同時操控兩種以上的處置,看各自成效與交互作用。
例:三種衛教方式(衛教本、光碟、兩者併用)對心導管檢查病患知識與焦慮的影響。
強在哪:一次比較多種介入;可看交互作用。
弱在哪:組數多、樣本需求大;解讀交互作用比主效果難。
不隨機之雙組前、後測設計 Nonequivalent control group pretest-posttest design
有對照組、有前後測,但分組不是隨機。臨床上最常見的一種。
例:纈草精油穴位按摩對重症病人睡眠成效,實驗組加精油按摩,對照組僅標準照護。
強在哪:前測可檢查兩組依變項是否同質(常用卡方),部分排除選樣效應;前測效應同時作用兩組。
弱在哪:未隨機化,干擾變項控制不完全,因果推論力低;結果推不到未做前測的族群。
時間序列設計 Time series design
處置前後各量好幾次,看趨勢有沒有在介入點轉折。
例:單位導入新流程前後各追蹤數個月的指標變化。
強在哪:多次測量可分辨「本來就在變」與「介入後才變」;也能用統計控制練習效應。
弱在哪:資料收集期長,個案流失與歷史事件的風險跟著變高。
交叉實驗設計 Crossover design
兩組在不同時段輪流接受不同處置,每個人都當過自己的對照。
例:穴位按壓緩解老人便祕:A 組真穴位 7 天→休息→假穴位;B 組順序相反。
再細分:變體:等候名單設計——對照組排在名單上晚一點拿處置,倫理上沒有人被剝奪介入。完整設計卡在頁尾全文,名詞解釋也查得到。
強在哪:兩組都接受過處置,排除選樣效應;連續三次收資料,看得出成效穩不穩。
弱在哪:研究期拉長,成熟與練習效應變強;個案流失風險高;需要沖洗期避免殘留效應。
等候名單設計 Wait-list control design
對照組不是不給處置,是排在等候名單上晚一點拿到;比較期結束後對照組也接受介入。
例:OSCE 訓練系統:A 組先用系統四週(B 組照常自習)→ 期中測 → 換 B 組用系統。
強在哪:倫理上沒有人被剝奪介入;每個人最後都拿到處置,招募較容易;延後組還能當第二次驗證。
弱在哪:等候期間對照組可能自尋其他資源(補償行為);研究期拉長,成熟與流失風險上升;延後測量混入時間效應。
敘述性研究設計 Descriptive research design
不給處置,把現況描述清楚:發生率、分布、樣態。可再分探索敘述、比較敘述、時間層面三種。
例:調查某群體胎兒酒精症候群現況,只能調查孕婦平日酒精攝取量,再與常模比較。
再細分:常見型式:調查研究、需求評估、次級資料分析、統合分析、德爾菲調查。
強在哪:變項無法操控、或倫理上不能分實驗與對照組時的正解;替後續實驗性研究鋪路。
弱在哪:只能描述與比較,說不出因果。
相關性研究設計 Correlational research design
看 A 變動時 B 會不會跟著動,用相關係數表示強弱與方向。
例:結腸造口病患的自尊狀況與應對方式的相關性。
強在哪:能直接測變項間的關係;可涵蓋敘述性研究的目的,先描述再找關係。
弱在哪:不能比較組間差異、不能測因果,也沒有控制與操縱變項。
橫斷面研究設計 Cross-sectional design
某一個時間點上,把一組或多組樣本的狀況一次收齊。
例:同一時間收集現有病人的判讀結果與參考標準,比較兩者一致性。
強在哪:省時、可行性高,適合看現況與盛行率。
弱在哪:因果先後說不清楚——要能合理推論變項的時序,還要有理論支撐。
縱貫面研究設計 Longitudinal design
同一群人追蹤一段時間,反覆收資料看變化。追蹤六個月以上是基本要求。
例:心臟移植病患出院後每月訪視一年,追蹤服藥順從性、生活品質與自我效能。
再細分:趨勢研究:同一母群多次抽不同樣本。世代分析:同一批人在固定時段內反覆分析。
強在哪:掌握得到變化的軌跡與速度,資料完整度高。
弱在哪:最大的敵人是個案流失與參與意願改變。
回溯性研究設計 Retrospective design
先看到結果,再往回查可能的原因。病例對照研究屬於這一類。
例:外科加護病房呼吸器相關肺炎的危險因素探討。
強在哪:罕見疾病、或曝露到發病要很久的題目,這是唯一做得動的路。
弱在哪:依賴回憶與既有紀錄,回憶偏差與資料缺漏都跑不掉。
前瞻性研究設計 Prospective design
先確認曝露,再往前追會不會發生結果。世代研究的主要走法。
例:1500 公克以下早產兒出生五天內腦壓平穩者,後續顱內出血情形。
強在哪:時序清楚,因果推論比回溯強。
弱在哪:費時費錢,個案流失會侵蝕結論。
實驗設計的三大特性
隨機化 Randomization
用隨機取樣或隨機分派把研究對象分成實驗組與對照組,讓兩組在給處置之前盡量相同。
判準是「每個樣本被分到任一組的機會相同,而且不等於零」。這是控制干擾變項與中介變項最有效的方法——不是最方便的,是最有效的。
操控 Manipulation
研究者主動給予自變項,再觀察依變項怎麼反應,而不是等它自然發生。
護理研究裡的操控可以是治療、措施、護理處置或衛教指導。例:精油按摩用在待產婦,自變項是精油按摩,依變項是焦慮程度與生理指標。
控制 Control
避免研究過程被干擾,以維持因果推論的可信度。
護理研究多在自然情境進行,做不到絕對控制,只能相對控制。三個原則:加大處置的變異量、控制無關變項、縮小不明的誤差。
真實驗與類實驗的比較
特性
真實驗性:隨機化、操控、控制三個要素同時具備
類實驗性:樣本未能隨機取樣;干擾變項或中介變項未獲得完全控制;不一定採用隨機取樣
優點
真實驗性:用隨機取樣嚴謹控制干擾變項與中介變項,對印證因果關係極具說服力;隨機取樣較能確保兩組樣本的同質性 最重要:採隨機取樣並做好控制,內在效度高。
類實驗性:設計貼近實際情境,結果較容易應用到實務;對變項的限制較少,個案取得容易;情境無需太多控制,執行上比真實驗方便 最重要:選擇自然情境、對變項控制較小,外在效度高於真實驗。
缺點
真實驗性:控制過多變項,結果較缺乏普遍的代表性;情境過度人工化,難推論到實際情境,較不適用於社會人文科學;需控制的干擾與中介變項多,研究對象取得不易 最重要:控制過多變項、情境過度人工化,外在效度極低。
類實驗性:未採隨機分配取樣,諸多變項難控制,因果關係容易受爭議 最重要:諸多干擾變項未控制,內在效度低於真實驗。
隨機對照試驗的四種偏差
選擇性偏差 Selection bias
發生在:病患樣本進入分組時
兩組在還沒給處置之前就已經不一樣,之後測到的差異分不清是處置造成的還是本來就有的。
控制方法:隨機分派
執行性偏差 Performance bias
發生在:分組之後、接受處置期間
受試者或照顧者知道自己在哪一組,行為就跟著改變——對照組可能更努力,實驗組可能更配合。
控制方法:雙盲
病患流失偏差 Attrition bias
發生在:追蹤期間
中途退出的人往往不是隨機退出的,可能正是效果不好或副作用大的那些人,只分析留下來的會高估效果。
控制方法:治療意向分析 ITT
檢測偏差 Detection bias
發生在:結果評估時
評估結果的人如果知道對方是哪一組,判讀就容易偏向預期的方向,主觀性越高的指標影響越大。
控制方法:臨床結果評估者盲
隨機分派的做法
簡單隨機
像擲銅板一樣逐一分派。樣本小的時候兩組人數可能差很多。
區段隨機
每若干人為一區段,在區段內分派,確保任何時間點兩組人數都接近。
分層隨機
先依重要特質(例如疾病嚴重度)分層,再在各層內隨機,避免該特質集中在同一組。
動態隨機
依已入組者的特質動態調整下一位的分派機率,讓兩組基準線盡量平衡。
效度威脅
內在效度
成熟化 Maturation
受試者隨時間自然長大或身心變化,成效被誤記在處置頭上。
對策:設對照組,讓自然變化同時作用在兩組。
歷史事件 History
研究期間發生預期外事件影響結果,長程或縱貫研究特別容易中招。
對策:縮短研究期、記錄期間重大事件、設同期對照組。
測試效應 Testing effect
前測提醒了受試者,讓他們刻意注意相關內容;重複測還會有練習或疲倦。
對策:拉長測量間隔、用 ANCOVA 把前測當共變項校正、或加設對照組。
變項對時間過度敏感 Time-sensitive variable
短時間的研究裡,變項本身就極容易隨時間改變,測到的變化未必來自處置。
對策:把測量時間點訂在變項穩定的區間;或改用時間序列,看趨勢而非單點。
選樣效應 Selection effect
沒隨機取樣或分派,兩組在給處置前就已經不同,基準線就有差。
對策:隨機分派;否則用前測檢查兩組同質性(常用卡方)。
工具信效度 Instrumentation
量表或儀器本身不穩、不準,測到的變化不是真的變化。
對策:報再測、複本或折半信度與內容效度;儀器定期校驗。
統計迴歸 Statistical regression
極端高分與極端低分者,過一段時間會自己往平均靠,沒處置也一樣。
對策:不要只挑極端組收案;設對照組比較。
個案流失 Attrition
中途退出或死亡,剩下的人跟原本的樣本不再是同一群。
對策:記錄流失人數與原因,做流失分析比較退出與留下者。
因果時序 Ambiguous temporal precedence
分不出誰先誰後,因果就講不清。
對策:前測—介入—後測的順序寫死,時間點明確交代。
處置擴散與模仿 Diffusion / imitation
兩組互相往來,實驗組把內容告訴對照組,對照組被汙染。
對策:分不同單位或時段收案,減少兩組接觸。
補償 Compensatory equalization
研究者對拿不到處置的對照組過意不去,私下給了別的東西。
對策:處置流程標準化;研究團隊與照護團隊分開。
力爭上游 Compensatory rivalry
對照組知道自己沒拿到,反而卯起來表現。
對策:盲化組別,不強調誰是實驗組。
自暴自棄 Resentful demoralization
對照組覺得被差別待遇而放棄配合,結果被壓低。
對策:盲化;或改用等待名單設計,事後補給處置。
霍桑效應 Hawthorne effect
知道自己被觀察就改變行為,研究一結束又打回原形。
對策:雙盲;追蹤期拉長看行為是否維持。
新奇效應 Novelty effect
因為新鮮好奇而改變表現,跟處置本身無關。
對策:延長觀察期,等新鮮感退去再測。
寬慰效應 Placebo effect
相信處置有效就真的好轉,或被告知是實驗組而產生預期。
對策:設安慰劑對照;不刻意強調成效,不標明誰是實驗組。
外在效度
樣本屬性限制太多 Sample characteristics
年齡、性別、地區限制越多,越難推論到別人身上。
對策:誠實寫出納入條件,限制段講清楚推論邊界。
情境控制過度 Reactive setting
實驗室裡控制得太完美,回到真實臨床就不成立。
對策:在自然情境收案,或另做實務場域的驗證。
樣本來源太特定 Volunteer / small sample
全是志願者或樣本數太小,代表性不足。
對策:多中心收案;報告參與者與未參與者的差異。
統計檢定
單一樣本卡方檢定 One-sample chi-square
差異 · 名義 · 一組|一組類別資料的實際分佈,和預期比例差多少。 R:chisq.test() SPSS:分析 → 無母數檢定 → 歷史對話記錄 → 卡方
費雪精確檢定/卡方 Fisher's exact test / chi-square
差異 · 名義 · 兩組 · 獨立|兩群不同的人,某個有/沒有的比例差不差。期望次數 <5 用 Fisher。 R:fisher.test() chisq.test() SPSS:分析 → 敘述統計 → 交叉表 → 統計量勾「卡方」(2×2 會自動附 Fisher 精確檢定)
McNemar 檢定 McNemar's test
差異 · 名義 · 兩組 · 成對|同一群人前後兩次的是/否有沒有翻轉。 R:mcnemar.test() SPSS:分析 → 敘述統計 → 交叉表 → 統計量勾「McNemar」
皮爾森卡方檢定 Pearson's chi-square
差異 · 名義 · 超過兩組 · 獨立|三組以上的人,類別比例分佈是否相同。 R:chisq.test() SPSS:分析 → 敘述統計 → 交叉表 → 統計量勾「卡方」
Cochran Q 檢定 Cochran's Q test
差異 · 名義 · 超過兩組 · 成對|同一群人被測三次以上的是/否有沒有變化。 R:cochran.qtest() SPSS:分析 → 無母數檢定 → 歷史對話記錄 → K 個相關樣本(勾 Cochran Q)
曼恩-惠尼 U 檢定 Mann–Whitney U
差異 · 序位 · 兩組 · 獨立|兩群不同的人,名次或等第誰比較高。獨立 t 檢定的無母數版。 R:wilcox.test() SPSS:分析 → 無母數檢定 → 歷史對話記錄 → 2 個獨立樣本(Mann-Whitney U)
魏克生符號等級檢定 Wilcoxon signed-rank
差異 · 序位 · 兩組 · 成對|同一群人前後兩次的名次有沒有移動。 R:wilcox.test(paired=TRUE) SPSS:分析 → 無母數檢定 → 歷史對話記錄 → 2 個相關樣本(Wilcoxon)
克-瓦二氏檢定 Kruskal–Wallis H
差異 · 序位 · 超過兩組 · 獨立|三群以上不同的人,等第分佈誰高誰低。事後用 Dunn。 R:kruskal.test() SPSS:分析 → 無母數檢定 → 歷史對話記錄 → K 個獨立樣本(Kruskal-Wallis H)
Friedman 檢定 Friedman test
差異 · 序位 · 超過兩組 · 成對|同一群人被測三次以上的名次變化。 R:friedman.test() SPSS:分析 → 無母數檢定 → 歷史對話記錄 → K 個相關樣本(Friedman)
單一樣本 z 檢定 One-sample z-test
差異 · 等距/等比 · 一組 · σ 已知|母群體標準差 σ 已知(或樣本很大)時,比較一組平均與已知標準。σ 未知就走 t 檢定——實務上幾乎都是 t。課程第 7 週與 t 檢定同一週上。 R:BSDA::z.test(x, sigma.x=) SPSS:SPSS 無內建;用單一樣本 T 檢定近似,或自行以公式計算
單一樣本 t 檢定 One-sample t-test
差異 · 等距/等比 · 一組|一組人的平均值,和某個已知標準差多少。 R:t.test(x, mu=) SPSS:分析 → 比較平均數法 → 單一樣本 T 檢定
獨立樣本 t 檢定 Independent t-test
差異 · 等距/等比 · 兩組 · 獨立|兩群不同的人平均值差不差。變異數不等用 Welch。 R:t.test(x~g) SPSS:分析 → 比較平均數法 → 獨立樣本 T 檢定(Levene 不顯著看上列,顯著看下列)
成對樣本 t 檢定 Paired t-test
差異 · 等距/等比 · 兩組 · 成對|同一群人前後兩次的平均值差多少。檢定的是差值的常態性。 R:t.test(x,y,paired=TRUE) SPSS:分析 → 比較平均數法 → 成對樣本 T 檢定
單因子變異數分析 One-way ANOVA
差異 · 等距/等比 · 超過兩組 · 獨立|三群以上不同的人平均值誰高誰低。顯著後做事後比較。 R:aov() TukeyHSD() SPSS:分析 → 比較平均數法 → 單因子變異數分析(Post Hoc 勾 Tukey 或 Scheffé)
多因子變異數分析 Factorial ANOVA
差異 · 等距/等比 · 自變項兩個以上|兩個以上自變項一起檢驗。主效果之外多了交互作用——交互作用顯著時先拆單純主效果,別急著解讀主效果。課程第 11、12 週連上兩週(期中考在第 9 週之後),屬期末考範圍。 R:aov(y ~ A*B) SPSS:分析 → 一般線性模式 → 單變量(固定因子放兩個自變項,看交互作用列)
重複測量變異數分析 Repeated-measures ANOVA
差異 · 等距/等比 · 超過兩組 · 成對|同一群人被量三次以上的平均值變化。需符合球形假設。 R:aov(+Error()) / lme SPSS:分析 → 一般線性模式 → 重複量數(Mauchly 違反看 Greenhouse-Geisser 列)
Phi、Cramer's V、邏輯斯迴歸 Phi, Cramer's V, logistic regression
關聯 · 名義|兩個類別變項的關聯強度;或用類別結果做預測。 R:assocstats() glm(family=binomial) SPSS:分析 → 敘述統計 → 交叉表 → 統計量勾 Phi 與 Cramer V;預測用 分析 → 迴歸 → 二元 Logistic
斯皮曼等級相關、Kendall's tau Spearman's rho, Kendall's tau
關聯 · 序位|兩個排名變項是不是一起上一起下。 R:cor(method="spearman") SPSS:分析 → 相關 → 雙變數(勾 Spearman 或 Kendall)
皮爾森積差相關、線性迴歸 Pearson r, linear regression
關聯 · 等距/等比|兩個連續變項的線性關係強度;或用它們預測結果。 R:cor.test() lm() SPSS:分析 → 相關 → 雙變數(Pearson);預測用 分析 → 迴歸 → 線性
生統自學地圖
先修 1 描述統計
集中趨勢、離散、分布形狀 R:summary() sd() hist() boxplot()
驗收:看著一張分布圖能說出該用平均數還是中位數,以及為什麼。
描述統計要回答的只有一件事:這批資料長什麼樣子。集中趨勢講中心在哪——平均數受極端值拉扯,中位數不會,所以住院天數、醫療費用這種右偏的資料報中位數才誠實。離散講散開的程度,標準差配平均數、四分位距配中位數,兩兩成對出現,不要混搭。分布形狀看偏態與峰度,也決定了後面能不能走參數檢定這條路。實務上先畫直方圖跟盒鬚圖再算數字,圖會先告訴你有沒有離群值、要不要換成中位數。論文的表一幾乎就是這一塊的產物。
先修 2 機率分布
常態分布、z 分數、中央極限定理、抽樣分布 R:rnorm() pnorm() qnorm()
驗收:能解釋樣本夠大時,平均數的分布為何會趨近常態。
這塊是推論統計的引擎室。常態分布給你一把尺,z 分數把任何測量換算成「距離平均幾個標準差」,不同量表因此可以互相比較。真正關鍵的是抽樣分布——不是資料的分布,是「統計量」的分布:想像重複抽無數次樣本,每次算一個平均數,這些平均數自己會形成一個分布。中央極限定理說,只要樣本夠大,這個分布會趨近常態,而且不管原始資料是不是常態。這就是為什麼一份偏態的資料仍然可以對它的平均數做檢定。標準誤是這個抽樣分布的標準差,跟標準差不是同一件事,兩者混用是很常見的錯。
先修 3 假設檢定邏輯
虛無與對立假設、α、p 值、型一型二錯誤、檢定力 R:先用模擬理解 p 值,不急著跑檢定
驗收:能用白話講對 p 值:假設虛無為真,看到這種或更極端結果的機率。
整個推論統計都建立在一個反證的動作上:先假設沒有差異(虛無假設),再問「如果真的沒差,我會看到現在這種資料的機率有多低」。低到說不過去,就推翻虛無。p 值就是那個機率,它不是「虛無為真的機率」,也不是「效果的大小」——這兩個誤解幾乎是所有統計錯誤的源頭。α 是你事先願意承擔的誤判風險,通常 .05,指的是型一錯誤:明明沒差卻說有差。型二錯誤反過來,明明有差卻沒抓到,機率是 β,而檢定力就是 1−β。p 值顯著只說「不太可能是巧合」,效果量才說「差多少」,兩個都要報。這塊懂了,後面每一種檢定都只是換公式而已。
先修 4 t 檢定
單樣本/獨立/成對;常態與變異數同質的前提 R:t.test()
驗收:拿到題目能判斷該用哪一種 t 檢定。
比平均數的三兄弟。單樣本比的是一群人跟一個已知標準;獨立樣本比兩群不同的人;成對樣本比同一群人的前後兩次。判斷用哪一種,關鍵在「這兩筆數字是不是同一個人身上來的」——同一個人就走成對,成對檢定的是差值,因此常態性要看的是差值而不是原始分數。獨立樣本要先看變異數同質(Levene 檢定),不同質就改用 Welch 校正,R 的 t.test() 預設就是 Welch。樣本很小又明顯不常態,改走無母數的 Mann-Whitney 或 Wilcoxon。課程第 7、8 週上這塊,也是期中筆試的主戰場。
先修 5 ANOVA
為何三組以上不能一直做 t 檢定、F 值、事後比較 R:aov() TukeyHSD()
驗收:能說出 ANOVA 顯著後為什麼還要做事後比較。
三組以上為什麼不能兩兩做 t 檢定?因為每做一次就冒一次型一錯誤的風險,做三次,整體犯錯的機率就從 .05 膨脹到接近 .14。ANOVA 用一次檢定處理全部,靠的是把總變異拆成組間與組內兩塊,F 值就是這兩塊的比值:組間比組內大得夠多,就表示分組真的有解釋力。但 F 顯著只告訴你「至少有兩組不一樣」,沒告訴你是哪兩組——所以要接事後比較,Tukey、Scheffé、Bonferroni 都是在控制膨脹的錯誤率下把兩兩比完。前提跟 t 檢定同一套:常態、變異數同質、觀察值獨立。
先修 6 卡方
適合度 vs 獨立性、期望次數、類別變項 R:chisq.test()
驗收:能判斷什麼樣的資料用卡方而不是 t 或 ANOVA。
前面幾塊都在比平均數,卡方比的是次數。資料是「幾個人屬於哪一類」而不是「每個人幾分」,就走這條。兩種用法:適合度檢定問一組類別的實際分布跟預期比例差多少;獨立性檢定問兩個類別變項有沒有關聯,資料排成交叉表。核心概念是期望次數——如果兩個變項真的無關,每一格應該有幾個人,實際與期望差越多,卡方值越大。期望次數小於 5 的格子太多,卡方就不可靠,2×2 表改用 Fisher 精確檢定。同一群人前後兩次的是與否要走 McNemar,不是卡方,這一題很愛考。
先修 7 相關與迴歸
Pearson r、簡單線性迴歸、R²、係數解讀 R:cor() lm() summary(lm)
驗收:能讀懂 lm 輸出的係數與 p 值。
相關問的是兩個連續變項有沒有一起動,Pearson r 介於 −1 到 1,只講強度與方向,沒有誰預測誰。迴歸多了方向性:用 X 去預測 Y,寫成 Y = a + bX,斜率 b 的意思是「X 每增加一單位,Y 平均變動多少」。R² 是 r 的平方,解讀成「Y 的變異有多少比例被 X 解釋掉」。這塊是後面所有模型的母體——邏輯斯迴歸、GLM、多層次模型全都是從這個式子長出來的,所以它值得花時間磨。最常見的錯是把相關當因果,以及在資料範圍外硬套預測(外推)。
課程主線 23–27,115-1 上課會考、但不在原本 00–22 系列裡的五個單元
23 多因子變異數分析
兩個以上自變項與交互作用;課程第 11–12 週
兩個以上的類別自變項、一個連續依變項,例如比較三種衛教方式與性別對自我效能的效果,這是一個 3×2 設計、六個細格。它比單因子多了一件單因子做不到的事:交互作用——一個自變項的效果會隨另一個自變項的層級而改變。判讀順序是死的:先看交互作用,顯著就暫緩解讀主效果,改拆單純主效果(固定一個因子的層級,再看另一個);不顯著才各自解讀主效果。用剖面圖判斷最直觀,兩條線平行表示沒有交互作用,不平行甚至交叉就是有。效果量報偏 eta 平方。課程排了整整兩週,是全學期唯一被排兩週的主題,期末必考。
24 簡單線性迴歸
一個自變項預測一個連續結果;課程第 13 週
從相關往前走一步:不只問兩個變項有沒有一起動,而是用 X 去預測 Y。方程式 Y = a + bX 裡,截距 a 是 X 為零時的預測值(很多時候沒有實質意義,別硬解讀),斜率 b 才是重點——X 每增加一單位,Y 平均變動多少。這條線怎麼畫出來的?最小平方法:讓每一點到線的垂直距離(殘差)平方和最小。R² 講這條線解釋掉多少變異,但 R² 高不代表模型對,可能只是外插到了資料範圍以外。前提有四項:線性、殘差常態、變異數同質、觀察值獨立,每一項都靠殘差圖檢查,不是靠感覺。
25 多元線性迴歸 MLR
多個自變項同時預測;調整後 R²、共線性 VIF;課程第 14 週
多個自變項同時進模型,最關鍵的概念是偏迴歸係數:每個係數的意思是「控制住其他所有自變項之後」,這一個變項自己的效果。這句話是多元迴歸的全部價值所在,也是最常被寫錯的地方。R² 有個先天問題——變項放越多它一定不會降,所以要看調整後 R²,它會為多餘的變項扣分。整體模型看 F 檢定,個別變項看 t 檢定,兩者問的問題不同。類別變項要轉虛擬變項,而且一定要交代參考組是誰,不然讀者無法解讀方向。共線性用 VIF 看,自變項之間高度相關會讓係數不穩甚至變號。
26 階層迴歸與模型選擇
分區塊投入變項看 R² 變化量;最佳方程式的選法;課程第 15 週
階層迴歸是研究者依理論決定投入順序:先放人口學變項當第一區塊,再放你真正關心的變項當第二區塊,看第二區塊帶來的 R² 變化量顯不顯著。這樣才能宣稱「在控制了年齡與性別之後,這個變項仍有額外解釋力」。它跟逐步迴歸的差別是根本性的——階層由研究者依理論決定,逐步由電腦依統計量決定,後者容易做出理論上說不通的模型,期刊審稿人多半不買單。判斷準則要分清楚:R² 看解釋量、調整後 R² 看有沒有為多餘變項付代價、F change 看每一區塊的增量、AIC 與 BIC 用在模型互相比較。
27 統計圖表與結果呈現
資料型態決定該用哪種圖;課程第 4 週(SPSS 製表與繪圖)
課程第 4 週整堂在講「算完之後怎麼呈現」——SPSS 怎麼製表、怎麼繪圖。這件事很容易被當成美工,其實它是統計判讀的一部分:選錯圖會把真正的訊息藏起來。心法只有一句,先問「我要讓人看出什麼關係」,再選圖,不是先挑一張好看的圖再把資料塞進去。比大小用長條,看一群數字的形狀用直方圖或盒鬚圖,看兩個連續變項的關係用散布圖,看隨時間變化用折線。前提檢查也靠圖:跑 t 檢定或 ANOVA 之前先畫 Q-Q 圖驗常態,這一步比事後補檢定有用。期末筆試考的是「看報表寫判讀」,圖表怎麼讀、怎麼選,就是同一種能力的兩面。完整對照見下方的圖表速查。
課程地基 00–06,與上面的先修是兩套編號
00 生物統計學入門
從樣本推論母群體的整套邏輯,把資料尺度、描述統計與假說檢定接起來。
這一集是把地基七塊串成一條線。核心是母群體與樣本的關係:我們永遠只摸得到樣本,卻想講母群體的事,中間靠的就是機率。資料尺度(名義、序位、等距、等比)決定了後面能用哪些統計方法,這是選檢定的第一個分岔點,也是站上檢定樹的第一個問題。描述統計負責把樣本講清楚,推論統計負責從樣本跨到母群體。把這一集聽完再往下走,00–22 每一集要解決的問題是什麼會清楚很多。
01 抽樣方法
機率與非機率抽樣怎麼選,抽樣誤差從哪裡來。
抽樣決定了你的結果能推論到誰身上,也就是外在效度的天花板。機率抽樣(簡單隨機、系統、分層、叢集)每個人被抽中的機率已知,才能估計抽樣誤差;非機率抽樣(方便、立意、雪球、配額)做不到,但護理臨床研究因為現實限制大量使用方便取樣,所以限制那一段要老實寫。分層抽樣的重點是層內同質、層間異質,適合母群體有明顯次族群的時候;叢集抽樣抽的是單位不是個人,例如整個病房,分析時要留意資料不獨立。抽樣誤差是隨機的、可以估計,抽樣偏誤是系統性的、加大樣本救不回來。
02 樣本數與檢定力
事前用 α、檢定力與預期效果量算出要收幾個人。
四個量互相牽制:α、檢定力、效果量、樣本數,定了其中三個,第四個就決定了。研究計畫書要做的是事前估計——設定 α 為 .05、檢定力 .80,再從文獻或前驅研究抓一個預期效果量,反推需要幾個人。效果量從哪來是這一塊最務實的難題,抓太大會低估樣本數,收完發現不顯著也解釋不了。事後檢定力分析(收完才算)幾乎沒有意義,因為它跟 p 值是同一個資訊的兩種說法。實務工具是 G*Power,要記得不同檢定選不同的檢定家族。樣本數估計是 IRB 與口試委員一定會問的一題。
03 無母數檢定
資料不符常態或樣本太小時的替代路線。
參數檢定要求資料符合特定分布(多半是常態),無母數不要求,改用等第或符號來做。對應關係要背熟:獨立 t 檢定對 Mann-Whitney U,成對 t 檢定對 Wilcoxon 符號等級,單因子 ANOVA 對 Kruskal-Wallis,重複測量對 Friedman。什麼時候換?樣本很小、明顯偏態、或依變項本身就是序位尺度(像李克特單題、疼痛分級)。代價是檢定力較低,資料真的常態時用無母數會比較不容易抓到差異。報告寫法也不一樣,中位數與四分位距取代平均數與標準差。
04 迴歸模型
用一組變項預測結果,係數怎麼解讀、模型撐不撐得住。
這一集是整個系列的樞紐——邏輯斯迴歸、GLM、Poisson、多層次、GEE 全部是它的變形,量表驗證那一支的 SEM 也建立在同一套迴歸思維上。要帶走的是三件事:係數怎麼解讀(控制其他變項後的邊際效果)、模型解釋力怎麼看(R² 與調整後 R²)、前提假設怎麼檢查(殘差常態、變異數同質、獨立、線性、共線性)。這一集聽懂了,07 到 09 只是把依變項從連續換成二元、次數或其他分布;17、18 只是把「觀察值獨立」這個假設放寬。它值得多聽兩次。
05 信效度分析
量表穩不穩、量到的是不是你要的東西。
信度問穩不穩,效度問準不準——穩定卻量錯東西是完全可能的,這就是那張靶心圖要講的事。信度看內部一致性(Cronbach α)、再測信度、評分者間信度(Kappa 或 ICC)。效度分內容效度(專家評,算 CVI)、效標關聯效度(跟黃金標準比)、建構效度(靠因素分析驗證結構)。實務上的順序是先有內容效度再談其他,因為題目本身就選錯了,後面的統計再漂亮也沒用。α 值高不等於單一構念,只是題目彼此相關;要證明結構還是得走 EFA 與 CFA。這一集是 10–13 那一支的入口。
06 ROC 與診斷準確性
敏感度與特異度、切點怎麼定、AUC 怎麼讀。
這一支是你論文的主線工具。敏感度問「有病的人裡抓出幾個」,特異度問「沒病的人裡放過幾個」,兩者互相拉扯——切點放寬敏感度上升、特異度下降。ROC 曲線就是把所有可能切點的這組取捨畫成一條線,曲線下面積 AUC 是整體區辨能力,.5 等於瞎猜、.7 到.8 算可接受、.8 以上算好。切點怎麼選要看用途:篩檢工具優先保敏感度(寧可誤報也不要漏掉),確診工具優先保特異度。陽性與陰性預測值會隨盛行率變動,這一點在推論到不同場域時特別重要。報告要照 STARD 指引。
迴歸家族 07–09,接 04
07 邏輯斯迴歸
結果是有或沒有時用的迴歸,輸出是勝算比。
依變項是二元(有/沒有、成功/失敗)時用的迴歸。為什麼不能直接用線性迴歸?因為機率被限制在 0 到 1 之間,線性模型會預測出範圍外的值。解法是把機率做 logit 轉換,拉成負無限大到正無限大的尺度再建模。係數取指數就是勝算比 OR:大於 1 表示勝算變大,小於 1 變小,等於 1 沒關聯。連續變項的 OR 解讀成「每增加一單位」,類別變項是「相對於參考組」,所以參考組一定要交代。它不需要依變項常態、也不需要變異數同質,這是跟線性迴歸最大的假設差異。樣本量的經驗法則是每個自變項至少十個事件。最常見的錯是把 OR 當相對風險解讀。
08 廣義線性模型 GLM
把線性迴歸推廣到不是常態分布的結果變項。
GLM 是把線性迴歸、邏輯斯迴歸、Poisson 迴歸收在同一個框架底下的說法。它把模型拆成三個零件:隨機成分(依變項服從哪個分布)、系統成分(自變項的線性組合)、連結函數(把兩者接起來的橋)。依變項常態、連結函數用恆等式,就是普通線性迴歸;依變項二項、連結用 logit,就是邏輯斯迴歸;依變項 Poisson、連結用 log,就是次數模型。理解這個框架的好處是,你不用把每種迴歸當成獨立的東西背,而是看依變項的性質去選分布與連結。18 的 GEE 就是在這個框架上再處理資料不獨立的問題。
09 Poisson/負二項
結果是次數時用的模型;過度離散就改負二項。
依變項是一段時間內發生幾次的計數資料——跌倒次數、再入院次數、感染件數——就走這條。Poisson 分布有個很強的假設:平均數等於變異數。真實的臨床資料常常不符合,變異數遠大於平均數,這叫過度離散 overdispersion,硬用 Poisson 會低估標準誤、把不顯著的東西做成顯著。這時候改用負二項迴歸,它多一個離散參數來吸收多出來的變異。如果零特別多(很多人一次都沒發生),還有零膨脹模型可以走。係數取指數解讀成發生率比 IRR。觀察時間長短不同的人要放 offset。
量表驗證 10–13,接 05
10 探索性因素分析 EFA
題目背後到底有幾個因素,先探索出來。
手上有一堆題目,但不知道背後有幾個構念,就用 EFA 把結構探出來。流程是:先檢查資料適不適合做(KMO 值與 Bartlett 球形檢定),再決定抽幾個因素(特徵值大於 1、陡坡圖、平行分析,其中平行分析最可靠),再做轉軸讓因素負荷量的樣態變清楚。轉軸分兩類,直交(varimax)假設因素之間不相關,斜交(promax)允許相關——心理與護理的構念多半彼此相關,斜交通常比較合理。判讀看因素負荷量,一般以 .40 或 .50 為門檻,同時在兩個因素上都高的題目叫交叉負荷,通常刪掉。EFA 是探索,不是驗證。
11 驗證性因素分析 CFA
驗證事先假設的因素結構撐不撐得住。
跟 EFA 相反:CFA 是你已經有理論或前人研究說「這份量表有三個構念、哪幾題屬於哪一個」,用資料去檢驗這個結構撐不撐得住。做法是把模型設定死,再看適配指標——卡方值(樣本大就容易顯著,不能單看)、CFI 與 TLI(大於 .90 可接受、.95 較佳)、RMSEA(小於 .08 可接受、.06 較佳)、SRMR(小於 .08)。指標不好可以參考修正指標調整模型,但每一次調整都要有理論說得通的理由,純為了衝指標而改是過度配適。跨族群要比較時還要做測量恆等性檢驗,否則分數不能直接比。
12 結構方程模型 SEM
同時處理測量模型與變項間的結構關係。
SEM 把兩件事合在一起做:測量模型(觀察到的題目怎麼反映背後看不見的潛在變項,也就是 CFA 那一塊)與結構模型(潛在變項之間誰影響誰)。好處是它把測量誤差納入估計,所以路徑係數比用加總分數跑迴歸更接近真值;也能一次檢驗一整套理論假設,包含中介路徑。代價是樣本要大、模型要有理論根據,而且適配好不等於因果成立——SEM 檢驗的是「資料與你提的模型相容」,不是「你的模型是對的」,同一組資料常常有好幾個適配同樣好的模型。報告要附路徑圖與標準化係數。
13 中介/調節分析
中介問「透過什麼」,調節問「在誰身上比較強」。
兩個很容易混的問題。中介 mediation 問機制:X 是透過 M 影響 Y 的嗎?例如衛教透過提升自我效能來改善自我照顧行為。現在的作法是直接檢定間接效果的顯著性,用 Bootstrap 取信賴區間,區間不跨 0 就成立,早年的 Baron & Kenny 四步驟已經不是主流。調節 moderation 問條件:X 對 Y 的效果在誰身上比較強?做法是放交互作用項,跟多因子 ANOVA 的交互作用是同一件事,只是自變項可以是連續的。顯著後要畫簡單斜率圖,分層呈現。兩者也可以合併成調節式中介。
一致性與診斷 14–16,接 06
14 Kappa/ICC
兩位評分者或兩次測量一致到什麼程度。
一致性不能只算「答案相同的比例」,因為就算兩個人亂猜也會有一部分碰巧一致。Kappa 的作用就是把碰巧一致的部分扣掉,只留下超出機遇的一致程度。用在類別資料,例如兩位護理師判斷傷口分期是否相同;有序類別可以用加權 Kappa,讓差一級跟差三級的懲罰不一樣。連續資料則用 ICC,它同時考慮相關與絕對一致,不同的模型設定(單向或雙向、一致性或絕對同意、單一或平均評分者)算出來的值不同,論文要交代用哪一種。判讀慣例是 .40 以下差、.40 到 .75 可接受、.75 以上好。你的研究要做雙人標註,這一塊會直接用到。
15 Bland-Altman
兩種測量方法能不能互換,看差值與一致性界限。
兩種測量方法能不能互相取代,不能用相關係數來回答——相關高只代表兩者一起上下,即使其中一台永遠多量 5 度,相關仍然接近 1。Bland-Altman 的作法是畫圖:橫軸放兩種方法的平均值,縱軸放兩者的差值,看差值散在哪裡。平均差值叫偏誤 bias,代表系統性的高估或低估;再畫出平均差值上下 1.96 個標準差的一致性界限,代表 95% 的差值會落在這個範圍。判斷的關鍵是臨床上能不能接受這個範圍,這是專業判斷不是統計判斷。也要看差值有沒有隨測量值大小而變化。
16 診斷準確性進階
多切點、分層,以及參考標準不完美時怎麼辦。
06 講的是單一切點與單一 AUC,這一集處理現實裡更麻煩的狀況。多切點時怎麼選最佳切點,Youden 指數是常見作法,但它假設誤判兩種方向的代價一樣,臨床上通常不是。不同族群的表現要分層報告,因為 AUC 會隨盛行率與病情嚴重度變動。參考標準不完美是最頭痛的一題——當黃金標準本身就會錯,算出來的敏感度與特異度都是有偏的,處理方式包括潛在類別分析或設定複合參考標準。還有兩種比較:同一群人身上比兩個工具的 AUC 要用相關樣本的方法,不能當成獨立樣本。
縱貫資料 17–18,接 04+08
17 重複測量/混合模型
同一群人測多次,資料不獨立就要用這個。
同一個人被量三次以上,這些數字彼此不獨立——同一個人的分數本來就比較像,直接用一般 ANOVA 會低估誤差。傳統作法是重複測量 ANOVA,但它有兩個現實上的痛點:球形假設常被違反(要看 Mauchly 檢定,違反就用 Greenhouse-Geisser 校正自由度),以及只要有一個時間點缺失,整個人就被剔除。混合效應模型是現在比較好的選擇:它把個體差異當成隨機效果處理,允許每個人有自己的起點甚至自己的斜率,而且能容忍不完整的資料與不等距的測量時間。縱貫性介入研究幾乎都往這裡走。
18 廣義估計方程 GEE
叢集或重複測量資料的族群平均效果。
跟 17 處理同一個問題——資料不獨立——但立場不同。混合模型估計的是「同一個人身上」的效果(受試者特定),GEE 估計的是「整個族群平均而言」的效果(族群平均)。要回答「這個介入對整體族群的平均效果是多少」,GEE 比較直接。它的做法是先指定一個工作相關結構(可交換、自迴歸、無結構),再用穩健標準誤修正——就算相關結構猜錯,係數估計仍然一致,這是它最好用的特性。依變項可以是連續、二元或次數,因為它建立在 GLM 的框架上。叢集抽樣(整個病房為單位)的資料也走這條。
統合分析 19–20
19 效果量合併:固定 vs 隨機
統合分析把各研究的效果量合起來,固定與隨機效應差在哪。
統合分析把多篇研究的效果量合成一個總估計,權重通常照變異數倒數給——樣本大、精確度高的研究講話比較大聲。兩種模型的差別在對「真實效果」的假設:固定效應假設所有研究在估計同一個真值,差異純粹來自抽樣誤差;隨機效應假設各研究的真值本來就不同(因為族群、介入劑量、場域不一樣),要多估一個研究間變異。護理領域的研究異質性通常大,隨機效應是比較誠實的預設。隨機效應的信賴區間會比較寬,小型研究的權重相對變大。結果用森林圖呈現,這是你系統性回顧的主要產出。
20 異質性 I²/漏斗圖
各研究之間差多少,以及有沒有發表偏差。
合併之前要先問「這些研究能不能合」。異質性用 Q 檢定與 I² 看,I² 是總變異裡有多少比例來自研究之間的真實差異而非抽樣誤差,慣例上 25% 低、50% 中、75% 高。異質性高不是把研究丟掉的理由,而是提示你去找原因——用次群組分析或統合迴歸看是哪個特徵造成的。發表偏差用漏斗圖看:把效果量對精確度畫散布圖,沒有偏差時應該對稱成漏斗形,缺一角通常代表小型的陰性結果沒被發表。Egger 檢定量化不對稱,但研究數少於十篇時檢定力太低,判讀要保守。
橫貫 21–22,隨時可插
21 多重插補(缺失值)
遺漏值不是刪掉就好,插補要保留不確定性。
缺失值直接刪掉會有兩個代價:樣本變小、以及如果缺得不隨機,剩下的樣本就有偏。先分辨缺失機制:完全隨機缺失(MCAR)刪掉還算安全,隨機缺失(MAR)可以用其他變項預測補回來,非隨機缺失(MNAR)最麻煩,缺失本身跟結果有關。用單一數值(例如平均數)填補是壞作法,它假裝我們對填進去的值有十足把握,會讓標準誤被低估。多重插補的邏輯是產生多份完整資料集,每一份的填補值都帶著隨機變異,各自分析後再依規則合併,這樣不確定性才會被誠實地反映在信賴區間裡。
22 多重比較校正
一次比很多次,型一錯誤會膨脹,要校正。
同一份資料上做越多次檢定,至少犯一次型一錯誤的機率就越高——做二十次,即使全部都是虛無為真,期望上也會有一次「顯著」。校正就是在控制這件事。Bonferroni 最保守,把 α 除以檢定次數,簡單但檢定力損失大,比較次數多的時候幾乎什麼都測不出來。Holm 是逐步版本,一樣控制族系錯誤率但比較有效率。FDR(Benjamini-Hochberg)換一個角度:不控制「有沒有犯錯」,而是控制「宣稱顯著的那些裡面有多少比例是誤報」,適合探索性分析與大量比較。要用哪一種,取決於誤報的代價有多高。
理論建構九宮格
概念衍生 Concept derivation
什麼時候用:你的現象還沒有合用的概念可以指稱,護理文獻幾乎是空白,但別的學科可能早就有話講。
怎麼走:把該主題現有文獻讀熟,確認真的沒有現成概念可用。 到別的領域找看事情的新角度。 挑一個能對應你現象的概念。 把它重新定義成護理情境裡說得通的樣子。
產出:一個借過來、重新定義過的新概念。
小心:不是換個名詞就算衍生。沒有重新定義,只是把別科的術語搬進護理。
陳述衍生 Statement derivation
什麼時候用:你知道兩個變項可能有關,但講不出關係的形狀;別的領域有現成的關係句可以借。
怎麼走:讀熟現有文獻,並評估現有的陳述夠不夠用。 到別的領域找新的關係說法。 挑選並改寫那個關係句。 把原本的概念換成你的護理概念。
產出:一句可以再往下檢驗的關係陳述。
小心:借來的關係在原領域成立,不代表換了變項還成立——那是待驗證的假設,不是結論。
理論衍生 Theory derivation
什麼時候用:整個現象缺一套解釋架構,而別的學科有結構相似的理論可以類比。
怎麼走:熟悉該主題現有的理論發展到哪裡。 用類比找到可借的母理論。 把母理論的結構抽出來。 用護理的概念把結構重新填滿。
產出:一套結構借來、內容重寫的新理論。
小心:跟兩個近親分清楚:微調現有理論是 adaptation,把構念接到實徵指標是 substruction,都不是衍生。
概念綜合 Concept synthesis
什麼時候用:臨床上看得到、講得出來,但還沒有名字的現象。質性、量性、文獻三種取徑都可以走。
怎麼走:大量接觸該領域的資料,直到理論飽和。 邊看邊分類,初期刻意讓分類鬆一點。 找出反覆聚在一起的現象叢集。 為叢集命名並給出定義。
產出:一個從資料長出來、之前沒有的新概念。
小心:太早收斂到一個名字,後面的資料就只會被塞進既有格子。
陳述綜合 Statement synthesis
什麼時候用:手上有觀察或資料,想把它變成一句可以推廣的關係。
怎麼走:從觀察走到推論——質性或量性方法都行。 把具體的推論一般化成比較抽象的陳述。 在兩個動作之間來回修,不必一次到位。
產出:一句有資料撐著的關係陳述。
小心:一般化跨太大步,陳述會抽象到無法檢驗。
理論綜合 Theory synthesis
什麼時候用:某個主題已經累積不少各自成立的關係,缺的是把它們組成一個整體。
怎麼走:指定焦點概念,或先框出幾個焦點概念組成的架構。 蒐集與焦點概念有關的關係陳述。 用圖把這些關係組織起來。 整理成一個有結構的理論。
產出:一張把既有發現接起來的理論架構圖。
小心:圖畫得出來不等於理論成立,每條線都要有來源。
概念分析 Concept analysis
什麼時候用:一個詞大家都在用但各說各話,或你要把它變成可以測量的東西。碩班作業最常做這一格。
怎麼走:選定概念。 決定分析的目的。 找出這個概念所有能找到的用法。 決定定義性屬性。 寫出模範案例。 寫出邊界、相關、相反、虛構、不合法案例。 找出前置因素與結果。 定出實徵指標。
產出:一個精準的定義、一組定義性屬性,以及可以拿去發展工具或題目的實徵指標。
小心:步驟是來回跑的不是直線。選概念要挑做得動的:太原始的只能靠舉例定義,太大傘的會包含好幾種意思。
陳述分析 Statement analysis
什麼時候用:你要評一句別人寫的關係句站不站得住,或要把自己的假設先自我檢查一遍。
怎麼走:選定要分析的陳述。 把陳述簡化。 分類這個陳述。 檢查句中概念的定義與效度。 標出概念之間關係的類型、方向與對稱性。 檢驗邏輯。 判斷可否檢驗。
產出:一份說得出「這句話哪裡不穩」的評析。
小心:最後一步最常被跳過:講得再漂亮,不能檢驗就無法進入研究。
理論分析 Theory analysis
什麼時候用:選理論當研究架構之前,或課堂上要評一個理論的時候。
怎麼走:指出理論的來源。 檢視理論的意義。 分析邏輯適當性。 判斷有沒有用。 界定可推廣程度與簡約性。 判斷可否檢驗。
產出:一份可以拿來說明「為什麼選它當架構」的理由。
小心:別只讚美。分析要講得出它的邊界在哪、哪裡推不過去。
護理理論家
哲學 Nursing philosophies
講的是護理的本質與價值,不直接給你變項,但決定你怎麼看病人。
Nightingale 現代護理
護理的工作是把病人放進最好的環境,讓身體自己的痊癒力發揮。她用 surroundings 這個詞,指的是通風、保暖、光線、飲食、清潔與安靜六件事。談環境與感染控制時的源頭。
Watson 超個人照護
照護是護理的道德理想,不是附加的親切。透過十個 caritas 過程與病人建立超越表面的照護關係。關懷行為、靈性照護、護病關係的質性研究常引。
Ray 科層照護理論
照護在醫院這種科層組織裡會被政治、經濟、法律與倫理拉扯,組織與照護互相形塑。適合談管理制度如何影響照護品質。
Benner 照護、臨床智慧與倫理
借 Dreyfus 技能習得模式,把護理能力分成新手、進階新手、勝任、精通、專家五階。專家靠的是累積的情境經驗,不是背規則。臨床能力進階與教育訓練的理論後盾。
Martinsen 照護哲學
護理奠基於對生命的照顧與鄰人之愛。人的依賴不是缺陷,而是人的處境本身,照護因此有倫理的重量。
Eriksson 關懷照護理論
caritas 是愛與慈悲的合一。受苦是照護的核心現象,護理要做的是減輕受苦,而不只是處理疾病。談尊嚴與受苦時很好用。
概念模式 Conceptual models
把人、環境、健康、護理四個核心概念組成一套完整世界觀,範圍大、可導出多個理論。
Levine 保存模式
護理透過四個保存原則協助病人適應:能量、結構完整、個人完整、社會完整。重症與活動耐受相關的照護容易對得上。
Rogers 單一人類
人與環境是不可分割的能量場,持續互動、不可逆地朝更複雜的模式演變。抽象度極高,適合當哲學立場,不容易直接操作成變項。
Orem 自我照顧缺失理論
由自我照顧、依賴性照顧、護理系統三個理論組成。核心判斷很簡單:當自我照顧能力小於需求,缺口出現,護理才介入。慢性病自我照顧與衛教成效研究的常客。
King 概念系統與目標達成
個人、人際、社會三個系統互相影響;護病透過溝通互相設定目標,達成才算有效。共同決策與目標設定型介入適用。
Neuman 系統模式
人是被彈性防線、正常防線、抵抗線層層包住的系統,壓力源穿透哪一層決定嚴重度。護理做的是初段、次段、三段預防。
Roy 適應模式
人透過生理、自我概念、角色功能、相互依賴四個模式回應刺激,護理促進適應反應。慢性病調適與因應的研究很常掛這一套。
Johnson 行為系統模式
人是由多個次系統組成的行為系統,各有目標與平衡;失衡時護理介入以恢復平衡。行為改變類主題適用。
理論與大理論 Theories and grand theories
比概念模式窄一點,開始講得出具體命題,但仍涵蓋很廣的現象。
Boykin & Schoenhofer 護理即照護
護理不是去解決一個有缺陷的人的問題,而是在照護的場合裡認出對方本來就是完整的人,並支持他繼續成為自己。
Meleis 轉變理論
人在健康疾病、發展、情境、組織這四類轉變中最脆弱,護理協助他經歷健康的轉變。出院準備、角色轉換、疾病歷程的研究很好接。
Pender 健康促進模式
用個人特質與經驗,加上行為特定的認知(知覺利益、知覺障礙、自我效能),預測健康促進行為。量表成熟、衛教介入研究引用率最高的一套。
Leininger 文化照護的多樣性與普同性
照護必須貼合文化,透過保存、調適、重塑三種行動達成文化一致的照護。跨文化、新住民與原住民照護的基礎理論。
Newman 健康即意識擴展
疾病不是健康的反面,而是整體模式的一部分;健康是意識不斷擴展的過程。
Parse 人類生成
三個原則:意義、韻律、超越。護理是與人同在,陪他選擇自己的健康方向,不替他決定。抽象度高。
Erickson, Tomlin & Swain 塑模與角色塑模
先進入病人的世界、用他的眼睛理解他(塑模),再據此設計介入(角色塑模)。無條件接納是整套的前提。
Husted & Husted 交響倫理理論
以 agency(行動能力)為核心的生命倫理。護病共同的目標,是把病人自主行動的能力還給他。
中範圍理論 Middle-range theories
概念少、範圍窄、變項測得到,碩論最常掛在這一層。
Mercer 母親角色達成
成為母親是一個互動且發展的過程:依附、學會照顧任務、逐步認同母親這個角色。產後適應與親職研究適用。
Mishel 疾病不確定感
當人無法判定疾病事件的意義、無法預測結果,就產生不確定感。它可能是威脅,也可能被重新框成機會。等待診斷、癌症治療期的研究非常常用。
Reed 自我超越
面對重病、失落、老化這些脆弱處境時,人會把界限往內、往外、往時間延展,藉此找到意義。安寧與老年研究適用。
Wiener & Dodd 疾病軌跡
疾病是在一個人的生命傳記裡展開的;自我概念會隨著「還能不能完成原本該做的事」而改變。
Eakes, Burke & Hainsworth 慢性哀傷
失落造成的落差持續存在,哀傷症狀會週期性再現,而且可能一次比一次強。長期照顧者與失能家庭的研究很貼。
Barker 潮汐模式
精神健康復元的重心在社區。人的一生是一片經驗之海,以他自己的故事為中心去協助復元。
Kolcaba 舒適理論
舒適需求來自壓力情境,而且是原有支持系統無法滿足的那部分,分生理、心靈、社會文化、環境四個面向。好操作化,舒適介入研究常用。
Beck 產後憂鬱理論
以現象學與紮根理論建構,核心是失控感與產後情緒障礙的歷程。產後心理健康篩檢的理論依據。
Swanson 照護理論
照護有五個歷程:知曉、同在、為對方做、使能、維持信念。五個歷程都測得到,很容易轉成介入或量表。
Ruland & Moore 安詳善終
五個結果指標:不痛、有舒適的經驗、有尊嚴被尊重、平靜、親近重要他人。安寧療護品質的評值架構。
易混淆概念
信度 reliability vs 效度 validity
同一把尺,量幾次都給差不多的數字。用 Cronbach's α、再測信度、評分者間信度來看。
這把尺量到的真的是你要的概念。用內容效度、建構效度、效標效度來看。
差在哪:量得穩不穩 vs 量到對不對
先有信度才談效度,但信度高不保證效度——每次都準準地量錯同一件事,也是很穩。
敏感度 sensitivity vs 特異度 specificity
真正有病的人裡面,被你判為陽性的比例。TP/(TP+FN)。漏掉的代價高就先顧這個。
真正沒病的人裡面,被你判為陰性的比例。TN/(TN+FP)。誤警太多會被關掉的系統就顧這個。
差在哪:有病抓得到 vs 沒病排得掉
兩者互相拉扯:把閾值調鬆,敏感度上去、特異度下來。要先講清楚哪一種錯誤比較不能接受。
型一錯誤 Type I vs 型二錯誤 Type II
虛無假設其實為真,卻被你拒絕了。發生率就是 α,通常設 .05。白話:亂報有效。
虛無假設其實為假,卻沒被拒絕。機率是 β,1−β 就是檢定力。白話:明明有效卻說沒效。
差在哪:沒差說成有差 vs 有差沒看出來
樣本數太小最常見的下場是型二錯誤——不是「證明沒效」,是「沒有能力看出來」。
發生率 incidence vs 盛行率 prevalence
一段時間內新發生的病例數,分母是原本沒病的人。看的是風險。
某個時間點上所有現存病例的比例,新舊都算。看的是負擔。
差在哪:新個案 vs 現有個案
病程長的慢性病盛行率會很高,但發生率可能不高。
療效 efficacy vs 成效 effectiveness
嚴格控制的研究情境裡有沒有用,像 RCT 裡的結果。
放到日常臨床、病人沒那麼配合的環境裡還有沒有用。
差在哪:理想條件下 vs 真實世界
效度的內外之爭在這裡具體化:控制越嚴,efficacy 越乾淨,effectiveness 越說不準。
關聯 association vs 因果 causation
兩個變項一起變動。相關性研究能講到這裡為止。
一個變項的改變造成另一個改變。要有操控、時序、排除干擾才敢講。
差在哪:跨過這條線就是推論跳躍
寫作時的檢查點:沒有操控自變項,就不要出現「造成」「導致」「使得」。
統計顯著 vs 臨床顯著
p < .05,表示這個差異不太可能只是抽樣誤差。樣本夠大時,微小差異也會顯著。
這個差異大到值得改變臨床作法。要看效果量與 95% CI 的範圍。
差在哪:p 值小 ≠ 臨床上有意義
報告請三個一起給:p 值、效果量、信賴區間。只給 p 值會被追問。
主效果 main effect vs 交互作用 interaction
A 自變項自己的效果,把 B 平均掉之後看。二因子設計有兩個主效果。
A 的效果隨 B 的層級改變。畫圖時兩條線不平行,就是交互作用的長相。
差在哪:各自的效果 vs 效果會不會互相改變
交互作用顯著時,主效果的解讀要讓位——先做單純主效果分析,逐層拆開看。
匿名 anonymity vs 保密 confidentiality
資料收上來就對不回是誰,研究者自己也查不出。
研究者知道是誰,但承諾不揭露,並以編碼、加密、權限控管保護。
差在哪:連研究者都不知道 vs 知道但不外洩
IRB 送件時這兩個詞不能混用,寫錯會被退件要求澄清。
複製 replication vs 可重製 reproducibility
換一批新資料、重跑一次研究流程,看結論還在不在。
拿原本那批資料、照原本的分析再算一次,數字要對得起來。
差在哪:新資料重跑 vs 舊資料重算
可重製是最低門檻,連原資料都算不出同樣結果就不用談複製了。論文的「未來研究建議」如果只寫「建議擴大樣本數」,等於什麼都沒建議。
名詞解釋
研究基礎・問題與假設
實證實務 evidence-based practice (EBP)
把最好的研究證據、自己的臨床經驗、病人的意願三者合起來做照護決定。三隻腳缺一不可:只看文獻叫套公式,只憑經驗叫憑感覺。它跟研究的分工是——研究「產生」知識,實證實務「使用」知識。
研究問題/目的 research problem / purpose
研究問題是臨床上卡住的那件事——想探討、想解決的現象,要講得出背景與重要性;研究目的則是你打算怎麼回答它的宣言。評讀文章時第一件事就是找這兩句在哪裡、寫得清不清楚。
研究目標 objective
把研究目的拆成幾條可以測量、可以逐一驗收的小句子,通常條列式,指明特定變項。目的講大方向,目標講「做完哪幾件事就算達成」。
假設/虛無假設 hypothesis / null hypothesis (H₀)
研究假設是你依文獻與經驗對結果的預測(有差、有關);虛無假設 H₀ 則預設「沒有差異、沒有關聯」。統計檢定的邏輯是反證:先假設 H₀ 為真,看資料有沒有極端到讓你推翻它。p 值講的永遠是 H₀ 底下的機率,不是你的假設對的機率。
自變項/依變項 independent / dependent variable
自變項是你動的——原因、介入、預測因子,實驗裡由研究者給;依變項是你看的——結果、反應,研究真正想改變的東西。寫研究問題時如果指不出這兩個,題目還沒收斂完。
干擾變項 confounding variable
跟自變項與依變項都有關的第三者,不處理就會把功勞或黑鍋錯記。例如比較兩種衛教成效時,兩組的教育程度不同——看到的差異可能來自教育程度而不是衛教。對付它的王牌是隨機分派,退而求其次是配對、分層或統計校正。
概念型/操作型定義 conceptual / operational definition
★ 概念型定義用文字講這個概念是什麼(引理論或文獻);操作型定義講實際上怎麼測——用哪份量表、誰來評、切點在哪。驗收標準:把操作型定義交給另一個人,他能照著測出同一個東西。口委最愛從「你的 X 怎麼測」切入。
變項 variable
研究裡會變動、能取不同數值的特質。依角色分成自變項(因)、依變項(果)、干擾(攪局的)、中介(傳遞效果的)、調節(改變效果強度的)。同一個變項在不同研究裡可以換角色——這次的依變項可以是下次的自變項。
中介變項 mediator
A 透過它影響 B——它是 A 的果、又是 B 的因,回答「效果怎麼發生的」。例如衛教(A)先提升自我效能(中介),自我效能再改善自我照顧(B)。檢驗用 Bootstrap 看間接效果的信賴區間,不是看兩條路徑各自顯不顯著。
調節變項 moderator
它決定 A 對 B 的效果有多強或往哪個方向,回答「在誰身上比較明顯」。例如衛教效果在低健康識能的病人身上特別大——識能就是調節。統計上就是交互作用項,顯著後要分層畫圖呈現。
PICO population, intervention, comparison, outcome
★ 把臨床問題拆成四塊:對象(P)、介入(I)、比較(C)、結果(O)。好處是一次到位——問題定了、檢索關鍵字有了、變項也指出來了。觀察型研究可換成 PECO(E 是曝露)。
證據等級 level of evidence
從專家意見(最低)一路到系統性回顧與統合分析(最高)的金字塔。用來快速判斷一篇文章的份量,但等級高不代表適用你的病人——一篇做在健壯成人的 RCT,對虛弱老人未必比一篇貼近族群的世代研究有用。
研究提案/研究質疑 research questions
把研究問題依性質轉成可探討的句子,列出變項與被測群體,好接資料收集與統計。位置在鏈上:主題→問題→目的→提案→假設。每個提案至少要有一個研究變項;實驗性研究常直接以研究假設代替提案。
單純性/複雜性假設 simple / compound hypothesis
單純性:一個自變項對一個依變項。複雜性:兩個以上的自變項或依變項。判斷方法就是數變項。
有方向/無方向假設 directional / non-directional hypothesis
有方向:能從理論或文獻預測誰高誰低(寫得出「較多、較少」),可用單尾檢定,統計上較敏感。無方向:只知道有關或有差,不知道方向,用雙尾檢定。沒有充分依據不能為了省樣本數硬用單尾。
研究目的四要素 four elements of research purpose
研究目的的敘述要涵蓋:研究設計、研究變項、母群體、研究場所。少一個,讀者就不知道你要在誰身上、用什麼方法、看什麼東西。
文獻查證
文獻回顧 literature review
把某主題的既有研究整理成一張「目前已知的地圖」,然後指出地圖上還空著的那一塊。收斂的終點是一句話:前人做到哪裡、還缺什麼、所以我要補哪一塊——寫成流水帳(A 做過…B 做過…)就是失敗的回顧。
系統性文獻回顧 systematic review (SR)
★ 依事先寫死的檢索策略與納入排除條件,把符合的研究全部找出來、逐篇評讀、綜整結論。關鍵在「可複製」——別人照你的方法應該找到同一批文獻。跟敘事型回顧的差別就在這個嚴謹度。
統合分析/範疇回顧 meta-analysis / scoping review
統合分析把多篇研究的效果量用統計方法合併成一個總估計,是系統性回顧的量化延伸;範疇回顧只盤點某領域有哪些研究、用了哪些方法,不合併數據也不評品質,適合題目還很新的時候。
研究缺口 research gap
★ 文獻回顧的終點:已知與未知的交界。缺口可以是族群沒做過、場域沒做過、方法有限制、結果互相矛盾。你的研究問題應該正好塞進這個缺口——這就是「研究的必要性」的來源。
納入/排除條件 inclusion / exclusion criteria
決定哪些文獻或個案算數的規則,開始前就要寫死,不能邊看邊決定——事後調整條件就是在挑對自己有利的資料。寫的時候要具體到可判定:「近五年、成人、有對照組」比「品質好的研究」可執行。
檢索策略/主題詞 search strategy / MeSH terms
檢索策略是你在資料庫下的完整查詢式,要記錄到別人能重跑。主題詞(如 MeSH)是資料庫給每篇文章貼的標準標籤,用它檢索比自由字詞完整——同義詞、縮寫、拼法差異都被歸到同一個標籤下。實務上兩者並用:主題詞求全,自由詞補新文獻。
布林邏輯/灰色文獻 Boolean operators / grey literature
AND 交集縮小範圍、OR 聯集放大範圍、NOT 排除——組合關鍵字的基本語法。灰色文獻指未經正式出版的研究:碩博士論文、研討會摘要、技術報告;系統性回顧要不要納入它,關係到發表偏差的處理。
偏差風險 risk of bias (RoB)
★ 逐篇評估納入研究「結果被系統性扭曲的可能」。工具依研究類型選:RCT 用 RoB 2、觀察型用 ROBINS-I、診斷準確性用 QUADAS-2。評讀時不是給總分,是逐面向判高、中、低風險。
同儕審查 peer review
稿件由同領域學者匿名審查後才決定刊登,是期刊品質的基本門檻。引用時優先選同儕審查期刊;未經審查的來源(維基、部落格、新聞)不能當正式學術引用。
引用 citation
引別人的話要對得回原文——頁碼、脈絡都要對。讀 A 文章時看到它引了 B,想用 B 的觀點就去找 B 的原文;直接轉引而不查證,等於把別人的轉述當事實,也是評讀時會被抓的點。
資料飽和 data saturation
質性研究決定樣本數的方式:訪談收到不再出現新的概念或主題就停。所以質性研究不事先算樣本數,而是報告「第幾位之後達到飽和」。量性研究的樣本數邏輯(檢定力分析)跟它完全是兩套。
一手/二手資料 primary / secondary source
一手:作者就是研究執行者,原創型研究。二手:把別人的結果整理轉述。查證以一手優先——批判指引直接問「引證的文獻都是一手資料?」,二手用多了會被扣。
理論性/實證性文獻 theoretical / empirical literature
理論性:支持主題與目的的學術文獻,如理論、模式、概念分析。實證性:經觀察或實驗獲得的知識,即原創研究。文獻回顧兩種都要有:理論撐架構,實證撐假設。
研究設計
概念/理論架構 conceptual / theoretical framework
把研究變項之間的關係畫成一張圖或寫成一段話,是整個研究的骨架。理論架構有現成理論撐腰(例如用自我效能理論導出假設);概念架構是自己綜整文獻搭的。評讀時看:架構裡的每條線,研究問題與假設裡有沒有對應?
描述性/相關性研究 descriptive / correlational study
描述性只回答「現在長什麼樣」——現況、頻率、分布,不碰變項間的關係;相關性往前一步問「兩件事有沒有一起動」,但仍然不給介入、不談因果。兩者都是非實驗性設計,常常是新題目的第一步。
橫斷式/縱貫式 cross-sectional / longitudinal
★ 橫斷式在一個時間點收所有資料,快而便宜,但分不出先後因果;縱貫式追蹤同一群人一段時間(慣例上六個月以上),看得到變化軌跡,代價是花時間、燒錢、樣本會流失。
世代研究/病例對照 cohort / case-control study
兩種觀察型設計,方向相反。世代研究從「曝露」出發往前追:抽菸者與不抽菸者各追十年,看誰得病;病例對照從「結果」出發往回查:找已得病與沒得病的人,回頭比誰曾經曝露。世代能算發生率,病例對照適合罕見疾病但怕回憶偏差。
回溯性/前瞻性 retrospective / prospective
回溯性是事情已經發生,翻病歷或請個案回想——快,但資料是別人當初記的,品質不受你控制;前瞻性是先定好要收什麼再往後追——資料品質好,但要等。同一個世代研究可以是回溯的(用舊病歷建世代)也可以是前瞻的。
隨機對照試驗 randomized controlled trial (RCT)
隨機分派+對照組+操控介入,三個要素齊備,是驗證因果的最強設計。隨機化把已知與未知的干擾一次抹平,所以它的證據等級排在單一研究的最頂端。代價是貴、慢、情境人工化,而且很多臨床問題根本不能隨機(不能叫人抽菸)。
類實驗設計 quasi-experimental design
隨機、操控、控制三要素缺一或缺二的實驗設計,最常見的是「不隨機的雙組前後測」。臨床現場常常沒辦法隨機(整個病房一起衛教),所以類實驗反而是護理介入研究的主力;代價是內在效度低一截,因果推論要更保守。
隨機分派/分派隱藏 random assignment / allocation concealment
隨機分派決定誰進實驗組誰進對照組,讓兩組起跑點相同;分派隱藏是不讓收案的人「事先知道」下一位會分到哪組——知道了就可能挑病人。兩件事常被混談:隨機做得再好,沒有隱藏照樣會偏。
盲化 blinding / masking
讓受試者(單盲)、加上照顧者與評估者(雙盲)不知道分組。防的是期待心理污染結果:受試者知道自己吃安慰劑就沒信心,評估者知道分組就往預期方向判。護理介入常常盲不了受試者(衛教藏不住),至少要讓「結果評估者」盲。
操控 manipulation
由研究者主動給予自變項——決定誰拿到處置、給多少、什麼時候給,而不是等它自然發生。這是實驗性設計跟觀察型研究的分水嶺:觀察型只能看,實驗型可以動手。
控制 control
把自變項以外會影響結果的因素壓住:隨機分派、納排條件、固定流程、統計校正都是手段。護理研究多在自然情境,做不到實驗室那種絕對控制,只能相對控制——所以設計時要講清楚控制了什麼、放掉了什麼。
量性/質性研究 quantitative / qualitative research
量性把現象化成數字,求測量與推論——問「多少、有沒有差、有沒有關」;質性收文字與經驗,求脈絡與意義——問「這對當事人是什麼感受、怎麼發生的」。兩者不是對立而是分工,混合方法研究就是兩邊一起用。
意向治療分析 intention-to-treat (ITT)
★ 照最初分派的組別分析,不管中途有沒有照做、有沒有換組,結果較保守。這樣才保住隨機化帶來的可比性,也是處理病患流失偏差的標準作法。
依計畫書分析 per-protocol
只分析「完全照流程走完」的受試者,中途退出、沒吃完藥的都剔除。聽起來乾淨,實際上會高估效果——因為留下來的往往是耐受性好、反應好的人。跟 ITT 是一對:ITT 保守、依計畫書樂觀,嚴謹的試驗兩個都報。
交叉設計 crossover design
兩組在不同時段輪流接受不同處置,每個人都當過自己的對照,個體差異被完全抵消,樣本數可以省一半。限制是只適合「效果會消退」的處置——開過刀的不能還原;兩段之間要留沖洗期。
沖洗期 washout period
交叉設計兩段處置之間的空白期,等前一段的殘留效果完全消退再開始下一段。沒有沖洗期或太短,第二段測到的就是兩種處置的混合效果——這叫殘留效應,是交叉設計最常被審的點。
時間序列設計 time series design
介入前後各測很多次(不是各一次),把趨勢畫出來,看轉折是不是剛好發生在介入點。多次前測讓成熟、季節這些趨勢現形,所以它是「沒有對照組時最強的類實驗」。品管的 run chart 就是同一個邏輯。
前實驗設計 pre-experimental design
連對照組都沒有(單組後測、單組前後測),或有對照但完全沒隨機。只能描述「有變化」,不能主張變化是介入造成的——成熟、歷史事件、迴歸平均都解釋得通。適合當先導研究,不適合當主研究設計。
選擇性偏差 Selection bias
兩組在進入研究時就已經不同,後面測到的差異分不清是處置造成的還是本來就有的。控制方法是隨機分派。注意跟抽樣那一組的「選樣偏差」不是同一件事:那個講的是樣本跟母群體不一樣(影響外在效度),這個講的是兩組彼此不一樣(影響內在效度)。
執行性偏差 Performance bias
受試者或照顧者知道自己在哪一組,行為就跟著改變。控制方法是雙盲。
病患流失偏差 Attrition bias
中途退出的人往往不是隨機退出的,可能正是效果不好或副作用大的那群;只分析留下來的會高估效果。控制方法是治療意向分析。
檢測偏差 Detection bias
評估結果的人知道分組,判讀就容易偏向預期方向,主觀性越高的指標影響越大。控制方法是讓臨床結果評估者盲。
區段隨機 Block randomization
每若干人為一個區段,在區段內做分派,確保任何時間點兩組人數都接近。
分層隨機分派 Stratified randomization
先依重要特質(例如疾病嚴重度)分層,再在各層內隨機,避免該特質集中在同一組。
動態隨機 Dynamic / minimization randomization
依已入組者的特質動態調整下一位的分派機率,讓兩組基準線盡量平衡。
等候名單設計 wait-list control design
對照組不是不給處置,是排在等候名單上晚一點拿到。倫理上比純空白對照好(沒有人被剝奪有效介入),又保留了比較期。代價是等候期間對照組可能自尋其他資源,且延後測量會混入時間效應。
多重因果 multicausality
一個結果往往由多個原因共同造成——心臟病同時來自抽菸年數、高脂飲食、缺乏運動。所以單一自變項顯著不代表它是唯一原因,設計與解釋都要為其他原因留位子。
信效度
信度/效度 reliability / validity
★ 信度問穩不穩:重複測會不會得到一樣的結果;效度問準不準:測到的是不是你要測的東西。穩定但量錯東西完全可能——磅秤每次都顯示同一個錯的數字。信度是效度的必要條件,不是充分條件。
內在一致性 internal consistency (Cronbach's α)
同一份量表的題目是不是在測同一件事,用 Cronbach α 表示,.70 以上可接受、.80 以上良好。注意它屬於信度不是效度——α 高只代表題目彼此相關,不代表量表測對了東西;這是最常見的失分點。
再測信度 test-retest reliability
同一群人隔一段時間(常見 2–4 週)再測一次,兩次分數的相關夠高(r ≥ .70)就算穩。前提是測的特質理論上要穩定——人格可以再測,當下的疼痛或情緒不行,間隔太短還會有記憶效應。
評分者間信度 inter-rater reliability (Cohen's κ)
★ 兩位以上評分者對同一份資料的判定一致程度:類別判定用 Cohen κ,連續分數用 ICC。任何需要人為判讀的測量(傷口分期、行為觀察、影像判讀)都要報這個,做法是雙人獨立評、再算一致性。
內容效度 content validity (CVI)
★ 量表的題目有沒有涵蓋要測的概念的全部面向,由專家逐題評分算出 CVI;慣例 CVI ≥ .80 可接受、≥ .90 佳。它是效度檢驗的第一關——題目本身就選錯了,後面統計再漂亮也救不回來。
建構/效標效度 construct / criterion validity
建構效度問量表是否真的測到抽象概念本身,靠因素分析、收斂與區辨來驗;效標效度問它跟公認標準(效標)對不對得起來,分同時與預測兩種。兩者加上內容效度,就是效度的三大支柱。
內在/外在效度 internal / external validity
★ 內在效度問「結果可不可信」——差異真的是介入造成的嗎;外在效度問「推不推得出去」——換一群人、換個場域還成立嗎。兩者天生互相拉扯:控制越緊內在越高、情境越人工外在越低。設計就是在這兩端找位置。
表面效度 face validity
量表「看起來」像不像在測那件事,問受試者或同僚的直觀印象。它是最弱的效度,不能單獨當效度證據;但有實務價值——看起來合理的量表,受試者比較願意好好填。
折半/複本信度 split-half / parallel-form reliability
折半:把量表題目分成兩半(常用奇偶題)互比,相關高表示內部一致;複本:準備兩份等值的量表 A 版 B 版,兩次施測用不同版,避開記憶效應。兩者都在檢驗「工具自己跟自己一不一致」。
天花板/地板效應 ceiling / floor effect
分數擠在量表的頂端(天花板)或底端(地板),大家都差不多,量表就分不出個體差異,也測不到變化——已經滿分的人再進步也看不見。選量表時要確認它的難度範圍跟你的族群對得上。
反應性 responsiveness
個案真的變好(或變壞)時,量表分數跟不跟得上。信效度都好的量表仍可能對「改變」遲鈍——題目測的是穩定特質而不是狀態。介入研究選結果指標時,反應性跟信效度一樣重要。
最小臨床重要差異 minimal clinically important difference (MCID)
★ 分數至少要差多少,病人才「感覺得出來」有差。統計顯著不等於臨床有意義——樣本大時 1 分的差也能 p < .05,但病人毫無感覺。報告介入效果時,拿差異對照 MCID 才知道值不值得做。
測量公式 O = T + E
觀察值=真實得分+測量誤差。誤差越小,觀察值越接近真實。整個信效度檢驗做的事,就是把 E 弄小、並且知道它有多大。
隨機誤差/系統性誤差 random / systematic error
隨機誤差:因機率產生、忽高忽低(受測焦慮、白袍高血壓),對應的是信度問題。系統性誤差:固定往同一方向偏(工具量錯東西、社會期待作答),對應的是效度問題。這組對應關係是講義的核心考點。
K-R20 Kuder-Richardson 20
內在一致性係數的一種,專用於二元作答(是/否、對/錯)的量表;Likert 型連續計分用 Cronbach α。大於 .80 良好、.70–.80 尚可。
專家效度 expert validity
內容效度的量化作法:請專家對每一題用四點量表評關聯性(1 沒有關聯~4 非常有關聯),算出得 3 或 4 分的題數比例,即 CVI。CVI>.80 高標準、>.90 最高標準。
同時效度/預測效度 concurrent / predictive validity
效標關聯效度的兩種。同時:與另一個測同一概念的工具同時施測,看相關。預測:現在的分數能不能預測未來的表現(例如入學考預測臨床能力)。差別只在效標發生的時間點。
收斂/區辨效度 convergent / discriminant validity
建構效度的一對。收斂:跟測相同概念的工具相關要高。區辨:跟測無關概念的工具相關要低。兩個方向都對,建構效度才站得住。
抽樣
母群體/樣本 population / sample
母群體是你想下結論的全部對象,樣本是實際收到的那一群。整個推論統計就是在做一件事:用樣本的數字去估母群體的真相。樣本能不能代表母群體,決定了結論能講多大聲。
立意/方便取樣 purposive / convenience sampling
★ 都是非機率取樣。方便取樣:收手邊拿得到的人,最省力、代表性最弱;立意取樣:依你的判準刻意挑「最能回答研究問題的人」,質性研究的主流。單一院所收案的量性研究多半是方便取樣——限制要老實寫。
隨機/分層取樣 random / stratified sampling
隨機取樣讓母群體裡每個人被抽中的機率相同且已知,是能估計抽樣誤差的前提;分層先按重要特徵(性別、病房別)分組再各自抽,保證小族群不會被抽漏。分層的原則:層內同質、層間異質。
樣本數估算 sample size calculation
★ 收案前用 α(.05)、檢定力(.80)、預期效果量三個參數反推要收幾個人,工具用 G*Power,並要外加預期流失率。計畫書必寫,口委必問;收完才補算的「事後檢定力」沒有意義。
檢定力/效果量 statistical power / effect size
檢定力是「效果真的存在時,你抓得到的機率」,慣例設 .80;效果量是「差異實際有多大」,跟樣本數無關。兩者跟 α、樣本數四個互相牽制——知道三個就能算第四個,這就是樣本數估算的原理。
選樣偏差/失訪 selection bias / attrition
選樣偏差:收進來的人跟母群體系統性不一樣(願意參加研究的人本來就比較健康);失訪:中途退出讓剩下的樣本再偏一次(退出的often是效果差的)。兩個都不是加大樣本能救的——偏差是方向問題,不是數量問題。
抽樣架構 sampling frame
用來抽樣的那份母群體名單。名單本身不完整,抽得再隨機也是偏的——用市話簿抽樣就漏掉只有手機的年輕人。報告抽樣方法時要交代名單從哪來、涵蓋了誰。
叢集抽樣 cluster sampling
以群體為單位抽(抽病房、抽學校),而不是抽個人。母群體太大、名單拿不到時的務實選擇;代價是同叢集的人彼此相似(同病房的病人像),資料不獨立,分析時要用叢集校正或多層次模型,樣本數也要多估。
滾雪球/配額取樣 snowball / quota sampling
滾雪球:由受試者介紹下一位,適合藏在人群裡的特殊族群(藥癮者、罕病家屬),代價是樣本彼此相識、同質性高;配額:先設定各層要收幾人再收滿為止,像分層取樣但層內不隨機。都是非機率取樣。
回應率 response rate
發出去的問卷實際收回的比例。低回應率的問題不是數量而是偏差——願意回的人跟不回的人可能系統性不同(滿意的人比較願意填滿意度問卷)。郵寄問卷慣例要報回應率並討論未回應者。
目標/可及母群體 target / accessible population
目標母群體:你想推論的全部對象(台灣所有乳房切除婦女)。可及母群體:其中你摸得到的部分(某院某期間的住院個案)。樣本從可及母群體抽,但推論宣稱只能寫到樣本能代表的範圍。
比例/非比例分層取樣 proportional / disproportional stratified sampling
比例:各層抽的人數照母群體的比例(男女 2:1 就抽 2:1)。非比例:某層人太少、照比例會沒代表性時,刻意多抽那一層。用了非比例,分析時要記得加權或分層報告。
系統隨機取樣 systematic random sampling
把母群體排好,算間隔數(母群體數÷樣本數),隨機選第一個,之後每隔一個間隔取一人。陷阱:名單若有週期性(例如每 10 床一個重症床)且週期跟間隔重合,就會系統性偏差。
倫理
知情同意 informed consent
受試者在「聽懂」研究內容後自願參加。三個要件:資訊(風險、利益、程序都講了)、理解(用對方聽得懂的話講)、自願(沒有壓力、不影響就醫權益、隨時可退出)。簽了名不等於知情——念過同意書不代表聽懂。
人體試驗委員會 Institutional Review Board (IRB)
研究開始前審查倫理與風險的委員會,由醫療、法律與社會公正人士組成。沒過審不能收案,改流程要送修正案,出意外要通報。計畫書、同意書、問卷都是送審文件。
免審/簡審 exempt review / expedited review
★ 風險程度決定審查層級:用既有的去識別化資料可申請免審;低風險(問卷、訪談)走簡易審查,快很多;有侵入性或弱勢族群就是一般審查。送件前先查該機構的分類標準,選錯層級會被退件重排隊。
匿名/保密 anonymity / confidentiality
匿名是「連研究者都不知道這份資料是誰的」(無記名問卷);保密是「研究者知道但承諾不外洩」(訪談一定做不到匿名,只能保密)。兩者在同意書上是不同承諾,寫錯會被退件——訪談研究寫「匿名」就是寫錯。
去識別化 de-identification
把姓名、病歷號、生日等可辨識資訊移除或換成編碼,讓資料對不回個人。對照表(編碼↔身分)要另存、上鎖、限定專人保管。是回溯性病歷研究申請免審或簡審的關鍵前提。
四大倫理原則 autonomy / nonmaleficence / beneficence / justice
自主(尊重個人決定,知情同意的根據)、不傷害(風險最小化)、行善(利益要大於風險)、正義(受試機會與負擔公平分配,不專挑弱勢收案)。倫理審查的每一項要求都能回溯到這四條。
弱勢族群 vulnerable population
兒童、孕婦、受刑人、認知功能障礙者、經濟或教育弱勢——自主決定能力受限、或處在權力不對等關係裡的人。收這些族群審查更嚴:要說明為什麼非他們不可、加什麼保護措施、誰代理同意。
利益衝突 conflict of interest (COI)
可能影響研究判斷的個人利益:經費來源、廠商關係、專利持有,都要主動揭露。特別的一種是「研究者同時是開發者」——評自己做的工具,設計上要用盲評、第三方收案來隔離。揭露不是有罪,隱瞞才是。
退出研究 withdrawal
受試者隨時可以退出、不需理由、不影響任何醫療權益,同意書必須白紙黑字寫明。已收的資料要不要跟著撤銷,也要事先講清楚。臨床對象特別容易「不好意思退出」,收案時要主動說明。
研究不當行為 research misconduct
國際上通用的三大類:捏造(無中生有)、竄改(修改真實資料)、抄襲(挪用他人成果不註明)。認定上不是灰色地帶——動機再良善、只改一點點,都算。
學術倫理六大不當行為 academic misconduct
造假(捏造不存在的資料)、變造(修改刪增真實資料)、抄襲(未註明引用他人成果)、自我抄襲(重複使用自己已發表的內容不註明)、重複發表、由他人代寫。國科會與教育部的處置從書面告誡到終身停權、追回經費。
人體研究法與醫療法 Human Subjects Research Act
台灣的人體研究法源。醫療法 78 條:非教學醫院原則上不得施行人體試驗。79 條:試驗前須書面同意,並告知目的方法、風險副作用、預期效果、替代方式、隨時撤回權、損害補償、資料保密、檢體保存再利用八項。人體研究法把審查依風險分一般程序與簡易程序。
資料收集與寫作
研究操作準則 study protocol
★ 從招募、取得同意、分組、給介入到收資料的一步步標準流程,寫到別人能照著執行。它是介入忠誠度的根據,也是 IRB 審查的核心文件——流程寫得越死,執行時越不會走樣。
項目負擔 item burden
受試者一次要填的總題數。幾份量表各自合理,加起來超過四十題就開始掉資料——後面的題目亂填、留白、拒填。設計時把所有工具攤開來數總題數,necessary 的才留。
閱讀水準 reading level
題目文字的難度。量表是給誰填的就要用誰的語言——對象讀不動,收到的就是猜的答案。對策:改口頭施測、換淺白版工具,或先導研究時實際請對象讀讀看。
譯碼簿 codebook
★ 每個變項的說明書:名稱、標籤、資料來源、測量尺度、有效範圍、遺漏值代碼。收案前建好,資料輸入與清理都照它走。沒有譯碼簿的資料檔,三個月後連自己都看不懂。
先導研究 pilot study
★ 正式收案前先收 3–5 位試跑全流程:測填答時間、抓題意混淆、修表單動線。發現問題的成本在這裡最低——正式收案後才發現量表有問題,前面收的都白收。
唯一識別碼 unique identifier
給每位受試者一個跟身分無關的編號,資料檔裡只出現編號。編號與身分的對照表分開存放、上鎖。這是去識別化的實作,也是資料外洩時的最後防線。
資料收集流程 data collection protocol
誰收案、在哪裡收、用什麼表單、按什麼順序——寫到別人能照做的程度。多位收案者時要先訓練、統一指導語,不然收案者本身就成了干擾變項。
遺漏值 missing data
空掉的資料格。處理方式(刪個案、刪變項、插補)要在分析前寫死,不能看結果不好再回頭改——那是在挑資料。同時要報告缺了多少、缺的人跟沒缺的人像不像。
IMRAD 架構 IMRAD (Introduction, Methods, Results, and Discussion)
量性論文的標準骨架:前言(為什麼做)、方法(怎麼做)、結果(看到什麼)、討論(代表什麼)。每一節有明確分工——結果只陳述數字不解釋,解釋放討論;方法要寫到可複製。
APA 第七版 APA 7th
投稿與報告的引用格式標準,管的是文內引用、參考文獻、表格圖片的寫法。細節多、易扣分:作者縮寫、斜體、DOI 都有規定。與其背,不如用書目管理軟體(EndNote、Zotero)自動產生再人工核對。
文獻評析 critique
用一致的架構逐項檢視一篇研究的每個環節——問題、設計、抽樣、工具、分析、結論,指出優點與缺失。重點是「憑判準」不是「憑印象」:每一句批評都要對應一條方法學理由。
研究限制 limitations
誠實寫出這個研究的推論邊界:樣本代表性、設計先天限制、測量工具的弱點。限制要自己先講,不要等口委幫你講。最後兩段——未來研究建議與複製可能性——要跟前面的限制一一對得上:你講了什麼限制,就建議下一個人怎麼補;並且把方法寫到別人照著能重跑一次。
資料清理 data cleaning
分析前把資料過一遍:超出有效範圍的值、前後矛盾的答案、重複輸入的個案。每一筆修改都要留紀錄(原值、改成什麼、理由)——清理過程本身要經得起審查。
離群值 outlier
離群體很遠的極端值。第一步永遠是查原始資料:是輸入錯誤就改正,是真實現象就不能直接刪——刪掉不喜歡的資料點是在造假邊緣。要嘛保留並用穩健方法,要嘛敏感度分析報告刪與不刪兩種結果。
訪員偏差 interviewer bias
訪談收資料時,訪員對題目或答案的詮釋、甚至穿著語氣,都可能把答案帶偏。對策:訪員訓練(熟悉問卷、互相模擬)、標準化指導語、持續追蹤訪問過程,必要時盲化訪員。
自己陳述/他人陳述 self-report / report by others
自己陳述:資料由個案本人提供,最直接,但敏感議題或個案無法表達時失效。他人陳述:由熟識者代答(失語症個案由主要照顧者),是替代方案,但心理感受類的資料不一定反映事實。兩者都可再分自填或訪談。
評析與質性
評析三步驟 identify / determine / evaluate
先辨認研究的每個元素(問題、設計、抽樣、工具、分析),再逐項判定優缺點,最後評估整體可信度與臨床意義。順序不能反過來——沒把元素找齊就下總評,就是憑印象。
信實度 trustworthiness
★ 質性研究的品質總指標,相當於量性的信效度,由四個成分合成:可信度(真不真)、可靠性(過程穩不穩)、確認性(是資料說話還是研究者說話)、轉移性(能不能用到別處)。評質性文章就照這四項逐一看。
可信度 credibility
質性版的「內在效度」:發現的主題是不是真的來自參與者的經驗。提升手段:待得夠久(延長接觸)、三角驗證(多來源、多方法互相對)、成員檢核(把整理的主題拿回去問參與者「是這個意思嗎」)。
可靠性/確認性 dependability / confirmability
可靠性問過程穩不穩:換個人照同樣步驟分析,會不會得到類似主題;確認性問結論是從資料長出來的、還是研究者自己的意見。兩者都靠審計跟蹤與反身性來支撐——過程留痕、立場交代。
轉移性 transferability
質性版的「外在效度」:這些發現能不能用到別的情境。質性不談統計推論,靠的是厚描述——把參與者與場域寫得夠仔細,讓讀者自己判斷「跟我的病人像不像」。
審計跟蹤 audit trail
★ 從原始逐字稿、編碼、備忘錄到主題形成的完整紀錄鏈,讓別人能追蹤「這個結論是怎麼一步步長出來的」。是可靠性與確認性的物證。
反身性 reflexivity
研究者交代自己的位置:我是誰、我跟參與者的關係、我的預設立場可能怎麼影響訪談與詮釋。質性研究者本人就是研究工具,所以工具的「校正紀錄」就是反身性聲明。
介入忠誠度 intervention fidelity
★ 介入有沒有從頭到尾照計畫書執行——每一位、每一次、每個劑量都一樣。評介入研究必問:沒有忠誠度資料,陰性結果分不清是「介入無效」還是「根本沒好好給」。監測手段:檢核表、錄影抽查、訓練認證。
理論飽和 theoretical saturation
紮根理論的停止收案準則:新的訪談不再產生新概念、新類別,理論的每個面向都有資料支撐。跟資料飽和意思相近,但更強調「理論建構完整」而不只是「沒新東西」。
複製與研究誠信
複製研究 replication study
用同樣或近似的方法把別人的研究再做一次,看結論站不站得住。科學的自我修正機制就靠這個——一篇研究只是一個證據點,複製成功才開始算數。
精確複製 exact replication
盡量照原研究的方法、工具、族群重跑一次,檢驗「原本那個結果是不是真的」。差異越小,檢驗力越純——如果連精確複製都重現不了,原結論就危險了。
近似複製 approximate replication
刻意換族群、換場域再做一次,檢驗「推不推得出去」。在台灣重做美國的研究就是近似複製——結果一致代表跨文化穩健,不一致則指出邊界條件,兩種都有價值。
建設性複製 constructive replication
只保留研究問題,方法、設計、測量全部重來,看同一個結論在完全不同的路徑下撐不撐得住。撐得住的結論才叫穩固——它不依賴任何特定方法的巧合。
可重製性 reproducibility
★ 跟複製不同:不重收資料,而是拿「同一批資料、同一套分析」看別人跑不跑得出同樣的數字。做到的前提是資料檔、程式碼、分析步驟都留檔可交——這也是現在期刊越來越要求的。
複製危機 replication crisis
大量已發表研究被重做時重現不了原結果的現象。根源:只有顯著才好發表(發表偏差)、彈性分析挑好看的報(p-hacking)、樣本太小效果量虛胖。因應之道就是事前登錄與公開資料。
事前登錄 preregistration
收案前把假設、樣本數、分析計畫登記在公開平台(如 ClinicalTrials.gov、OSF)。之後改了什麼大家都看得見——防的是「看完結果再決定假設」。臨床試驗不登錄,很多期刊直接拒收。
未來研究建議 recommendations for future research
★ 要從自己的限制長出來,不是客套句。公式:我的限制是 X → 所以下一個研究應該用 Y 補上。「建議擴大樣本數」這種罐頭句等於沒寫——要指名道姓地對應自己承認過的弱點。
統計
描述/推論統計 descriptive / inferential statistics
描述統計把手上的資料講清楚:平均、分布、百分比,只談樣本自己;推論統計從樣本往母群體跳:檢定、信賴區間、迴歸。論文的表一是描述統計,表二以後才進推論。
平均值、標準差 mean, standard deviation (SD)
平均值是資料的重心;標準差是資料平均離重心多遠——同樣平均 70 分,SD 5 是大家都差不多,SD 20 是高低懸殊。兩者成對出現,而且都只適合對稱分布的資料。
中位數、四分位距 median, interquartile range (IQR)
中位數是排序後正中間那個值,四分位距是中間 50% 資料的範圍。兩者都不受極端值拉扯,所以偏態資料(住院天數、醫療費用)要報這一組,不是平均±標準差。
顯著水準、p 值 significance level (α), p-value
★ p 值的正確定義:假設虛無為真,看到這種或更極端結果的機率。它不是「虛無為真的機率」、更不是「效果大小」——樣本夠大,微小差異也能 p<.001。α 是事前訂的判準(.05),p<α 才說顯著。
信賴區間 confidence interval (CI)
★ 用樣本估母群體時給的範圍:95% CI 的意思是「重複抽樣一百次,約九十五次的區間會蓋住真值」。它比 p 值多給了資訊——區間寬窄告訴你估得多精準,區間位置告訴你效果多大。差異的 CI 跨過 0、比值的 CI 跨過 1,就是不顯著。
第一/二型錯誤 Type I / Type II error
第一型:沒效說有效(誤報),機率是 α;第二型:有效沒看出來(漏報),機率是 β。兩者蹺蹺板——α 壓越低,β 越高;唯一能同時壓低兩者的方法是加大樣本。
卡方、t 檢定、變異數分析 chi-square test, t-test, ANOVA
三個最常用的檢定,按資料型態分工:卡方比類別變項的比例(清腸合格率兩組差不差)、t 檢定比兩組的平均(焦慮分數)、ANOVA 比三組以上的平均。選錯檢定是評讀時最容易抓到的錯。
迴歸 regression
用一個或多個變項預測結果的統計模型。依變項是連續數值用線性迴歸,是有/無二元用邏輯斯迴歸。它比相關多做一步:控制其他變項後看每個因素的獨立貢獻。
自由度 degrees of freedom (df)
計算統計量時「可以自由變動的資訊個數」,通常跟樣本數與參數個數有關。報告 t、F、χ² 時都要附上(如 t(58)=2.31)——沒有自由度,讀者無法查表核對。
常態性檢定 normality test (Shapiro-Wilk)
檢查資料是否近似常態分布,用 Shapiro-Wilk 檢定或 Q-Q 圖。它決定走參數(t、ANOVA)還是無母數(Mann-Whitney、Kruskal-Wallis)那條線。樣本大時檢定容易過度敏感,配合圖判斷比只看 p 值可靠。
變異數同質性 homogeneity of variance (Levene)
各組資料的分散程度要差不多,是 t 檢定與 ANOVA 的前提,用 Levene 檢定查。不成立時不必硬掰:t 檢定改用 Welch 校正(R 的預設就是它),ANOVA 用 Welch ANOVA。
事後比較 post hoc test
ANOVA 只說「至少有兩組不一樣」,沒說是哪兩組——事後比較就是在控制型一錯誤膨脹的前提下把兩兩比完。常用 Tukey(各組人數相近)、Scheffé(保守)、Bonferroni(最嚴)。顯著才做,不顯著就停。
效果量 effect size
★ 差異實際有多大,跟樣本數無關。Cohen’s d 的慣例:0.2 小、0.5 中、0.8 大。p 值只說「不太可能是巧合」,效果量才說「差多少」——兩個都要報,只報 p 值的文章評讀時直接扣。
勝算比/相對風險 odds ratio (OR) / relative risk (RR)
★ 都是比較兩組風險的指標:RR 是發生率直接相除,好懂;OR 是勝算相除,邏輯斯迴歸的輸出。結果不罕見時 OR 會比 RR 誇大,不能直接當 RR 解讀。兩者都必附 95% CI,區間跨過 1 就是不顯著。
決定係數 R²
迴歸模型解釋了依變項多少比例的變異,0 到 1。R²=.30 表示模型講掉三成的變異、七成還是不知道。它只講解釋力,不講模型對不對——加變項它永遠只升不降,所以多元迴歸要看調整後 R²。
調整後 R² adjusted R²
把自變項個數納入懲罰後的解釋力;多元迴歸要報這個而不是 R²
階層迴歸 hierarchical regression
★ 依理論順序分區塊投入自變項,看每一區塊帶來的 R² 變化量
R² 變化量 R² change
★ 階層迴歸的關鍵輸出:新加的那一組變項多解釋了多少
逐步迴歸 stepwise regression
讓軟體依統計準則自動增刪變項;容易過度配適,理論驅動時優先用階層
迴歸係數 beta coefficient (β)
未標準化 B 是原始單位的效果;標準化 β 可跨變項比較相對重要性
多重共線性 multicollinearity
自變項彼此太相關,係數會不穩;看 VIF
主效果 main effect
多因子設計裡,一個自變項「自己」的效果——把另一個自變項的各層平均掉之後看。交互作用顯著時主效果是被平均掉的假象,不能直接解讀,要先拆單純主效果。
交互作用 interaction
★ 一個自變項的效果隨另一個自變項的層級而改變——衛教效果在男性大、女性小,就是衛教×性別有交互作用。判讀順序是死的:先看交互作用,顯著就拆單純主效果,不顯著才各自解讀主效果。
單純主效果 simple main effect
交互作用顯著後的拆解動作:固定一個自變項的層級(只看女性),再檢驗另一個自變項的效果(三種衛教差不差)。逐層拆開,才知道交互作用長什麼樣。
多重比較校正 multiple comparison correction
同一批資料檢定做越多次,至少一次誤報的機率越滾越大——做 20 次檢定,全是虛無也期望出現一次「顯著」。校正方法:Bonferroni 把 α 除以次數(保守)、FDR 控制誤報比例(探索性分析適用)。
截距 Intercept
迴歸線在 X 為零時的預測值。很多情境下 X 根本不可能是零(例如年齡、體重),這個數字就沒有實質意義,不要硬解讀。
斜率 Slope
迴歸係數 b:X 每增加一單位,Y 平均變動多少。迴歸真正在看的就是它。
殘差 Residual
實際觀察值減去模型預測值。迴歸的前提假設——線性、常態、變異數同質——全都是靠殘差圖檢查,不是靠感覺。
最小平方法 Least squares
決定迴歸線畫在哪裡的方法:讓所有殘差的平方和最小。
偏迴歸係數 Partial regression coefficient
多元迴歸裡每個自變項的係數,意思是「控制住其他所有自變項之後」,這一個變項自己的效果。這句話是多元迴歸的全部價值所在。
虛擬變項 Dummy variable
把類別自變項轉成 0 與 1 才能放進迴歸。k 個類別要用 k−1 個虛擬變項,沒被編碼的那一類就是參考組。
參考組 Reference group
類別變項在迴歸裡被當成比較基準的那一組。所有係數都是「相對於它」而言,所以報告一定要交代參考組是誰,否則讀者無法解讀方向。
容忍度 Tolerance
共線性指標,等於 1 減去該自變項被其他自變項解釋掉的比例;VIF 是它的倒數。容忍度太低就代表共線性太嚴重。
AIC/BIC Akaike / Bayesian information criterion
模型比較用的指標,同時衡量適配度與模型複雜度,數字越小越好。只能拿來比較同一批資料的不同模型,不能跨資料比。
外推 Extrapolation
拿迴歸式去預測資料範圍以外的 X 值。那一段線長什麼樣子沒有人驗證過,預測不可信。
剖面圖 Profile plot
多因子 ANOVA 用來看交互作用的圖:各細格平均連成線,線大致平行表示沒有交互作用,不平行甚至交叉就是有。
Q-Q 圖 Q-Q plot
把資料的分位數對上常態分布的分位數畫成圖。點大致落在對角線上就接近常態,明顯彎曲就不是。跑 t 檢定或 ANOVA 前用它驗前提。
帕累托圖 Pareto chart
長條由高到低排列再配上累積百分比線,用來找出「少數幾項就佔掉大半」的關鍵項目。品管分析常用。
熱力圖 Heatmap
用顏色深淺呈現二維表格的數值高低,適合兩個維度交叉時一眼看出熱區。
存活曲線 Kaplan-Meier curve
呈現「事件發生前還有多少比例沒發生」隨時間下降的階梯圖,用於追蹤資料;兩組比較用 log-rank 檢定。
點估計/區間估計 point / interval estimation
點估計:用單一數值(樣本平均)估母群體參數,著眼 p 值。區間估計:給一個範圍(95% 信賴區間),著眼區間有沒有跨過無效值。期刊越來越要求兩個都報。
68-95-99.7 法則 empirical rule
常態分布下,平均數 ±1 個標準差涵蓋 68% 的資料、±2 個涵蓋 95%、±3 個涵蓋 99.7%。z 檢定、信賴區間、離群值判斷都建立在這條上。
護理理論
後設典範 metaparadigm
護理學科最上層的四個核心概念:人、環境、健康、護理。每一個護理理論都是在回答「這四者是什麼、彼此什麼關係」——評讀理論時第一步就是找它對四大典範的立場。
概念模式 conceptual model
把四大典範組成一套完整世界觀的架構,範圍比理論大、抽象度更高——Orem 的自我照顧、Roy 的適應模式都是。模式提供看護理的「眼鏡」,理論才提供可檢驗的命題。
大理論/中範圍理論 grand / middle-range theory
大理論涵蓋整個護理現象,抽象到幾乎無法直接檢驗;中範圍理論只處理一段特定現象(不確定感、舒適、母親角色),概念少、可測量、可以直接拿來設計研究——碩士論文掛理論幾乎都掛中範圍。
實務理論 practice theory
最貼床邊的一層:針對特定情境、特定族群的處方型理論,直接告訴你「這種情況該做什麼」。從大理論、中範圍到實務理論,是抽象度一路下降、可操作性一路上升的階梯。
借用理論 borrowed theory
從心理學、社會學等其他學科借來用於護理的理論——自我效能、計畫行為理論都是。借用不是問題,不交代「為什麼適合護理情境」才是問題;用之前要說明它在護理脈絡下站不站得住。
定義性屬性 defining attributes
★ 概念分析的核心產出:這個概念「一再出現、少了就不是它」的特徵清單。判斷方法:拿掉這個屬性,案例還算不算這個概念?算,就不是定義性屬性。量表的構面就從這裡長出來。
模範案例 model case
把所有定義性屬性都具備的典型例子,通常是一段具體的臨床敘事。功能是「示範這個概念長什麼樣」——讀者看完案例就能認出這個概念。可以是真實案例也可以是建構的。
相反案例 contrary case
明顯「不是」這個概念的例子,用來反襯邊界——把疲憊的相反案例寫成精力充沛的人,讀者就知道疲憊不包含什麼。跟模範案例一正一反,把概念的輪廓夾出來。
前置因素/結果 antecedents / consequences
前置因素是概念發生「之前」必須存在的條件,結果是概念發生「之後」帶來的改變。注意前置因素不能跟定義性屬性重複——先有的條件不算概念本身的特徵。這兩塊在概念分析報告裡都要有文獻支持。
實徵指標 empirical referents
★ 可以實際觀察或測量到定義性屬性的具體東西——屬性是「主觀疲憊感」,實徵指標就是疲憊量表的分數。它是概念分析的終點、工具發展的起點:量表題目從這裡長出來。
邏輯適當性 logical adequacy
理論內部推理的品質:概念定義前後一致嗎、命題之間有沒有矛盾、結論跟得上前提嗎。評理論的方法是把命題排出來逐條對——邏輯有洞的理論,實證做得再多也補不了。
簡約性 parsimony
用越少的概念與命題講清楚越多現象,理論越好。兩個解釋力相同的理論,選簡單的那個。評讀時的問法:這個理論有沒有哪個概念拿掉也不影響解釋力?有,就不夠簡約。
可檢驗性 testability
★ 理論能不能轉成「可以被資料推翻」的假設。不可檢驗的理論再漂亮也只是哲學——你要能從它導出「如果理論對,資料應該長這樣」的預測。中範圍理論比大理論吃香,就是因為檢驗得動。
命題 proposition
理論裡描述概念之間關係的陳述句——「自我效能越高,自我照顧行為越多」就是一條命題。理論的骨架就是一組命題;研究假設就是把命題翻譯成可測量的版本。
概念與構念 concept / construct
概念是對現象的心智描述,可以較具體(疼痛);構念是為了理論目的特別建構的高階抽象(自我效能、生活品質),一定要透過多個指標間接測。分辨的意義在測量:越抽象的構念,測量的層次要求越多。
操作化 operationalization
★ 把抽象概念一路變成測得到的東西:構念→概念→指標→變項。「焦慮」操作化成「STAI 量表分數」就是一次完整的操作化。理論與研究的接點就在這裡——操作化做壞了,測到的就不是理論講的那個東西。
診斷準確性
診斷準確性 diagnostic accuracy
待驗證的工具(指標試驗)跟公認的真相(參考標準)比對,看判得多準——輸出就是敏感度、特異度那一套。它是工具驗證研究的核心典範,報告要照 STARD 指引。
指標試驗 index test
★ 研究裡「待驗證」的那個工具——新的判讀系統、新量表、新檢驗。整個診斷準確性研究的問題就是:指標試驗的判定,跟參考標準的判定有多一致。
參考標準/金標準 reference standard / gold standard
★ 拿來當「真相」的判定方法,通常是該領域公認最準的作法(病理切片、專家共識判讀)。金標準怎麼操作化是口委必問——用會出錯的標準當真相,算出來的準確度全是有偏的。
敏感度/特異度 sensitivity / specificity
★ 敏感度:真的有病的人裡,工具抓出幾成(漏掉的是偽陰性);特異度:真的沒病的人裡,工具排除幾成(誤抓的是偽陽性)。切點一動兩者就互相消長:篩檢要敏感度優先,確診要特異度優先。
陽性/陰性預測值 positive / negative predictive value
換一個方向問:工具說有病的人裡,幾成真的有病(PPV);說沒病的裡,幾成真的沒病(NPV)。跟敏感度特異度不同,這兩個會隨盛行率變動——同一個工具在盛行率低的族群 PPV 會掉很低,推論到不同場域時要特別小心。
真陽性/假陽性 true positive / false positive
2×2 表的四格之二:真陽性是有病也判有病(抓對),假陽性是沒病卻判有病(誤報)。另外兩格是真陰性(排對)與假陰性(漏掉)。所有準確性指標都是這四格的組合。
混淆矩陣 confusion matrix
把真陽性、假陽性、真陰性、假陰性排成的 2×2 表,是診斷準確性分析的原始帳本——敏感度、特異度、預測值全部從這四格算出來。報告時附上它,讀者才能自己驗算。
ROC 曲線/曲線下面積 ROC curve / area under the curve (AUC)
把所有可能切點的「敏感度 vs 偽陽性率」畫成一條曲線,AUC 是曲線下面積:0.5 等於瞎猜、0.7–0.8 可接受、0.8 以上好。前提是工具要輸出連續分數——只出「是/否」的工具畫不了 ROC。
一致性 agreement / concordance
兩個判定者(或工具與標準)給出相同判定的程度:類別判定用 kappa(扣掉碰巧一致的部分),連續數值用 ICC。kappa 的慣例:.40 以下差、.40–.75 可接受、.75 以上好。
涵蓋率 coverage
工具「判得出來」的比例——有些案例它會說「無法判定」。涵蓋率跟準確度會互相拉扯:只挑有把握的判,準確度好看但涵蓋率低。報告兩個都要給,只報準確度會膨脹工具的實用性。
報告指引 STARD reporting guideline
★ STARD 是診斷準確性研究的報告清單:收案流程圖、指標試驗與參考標準的操作定義、盲不盲、不確定結果怎麼算,逐項都要交代。寫計畫書時就照清單逐條檢查,投稿與口試都會被對著查。
切點 cut-off
把連續分數切成陽性/陰性的那條線。切點一動,敏感度與特異度就反向消長——選切點是取捨不是計算:Youden 指數給「數學最佳」,但臨床要考慮兩種誤判的代價不相等。
概似比 likelihood ratio (LR+/LR−)
★ 檢驗結果把罹病機率往上或往下推多少倍:LR+ 越大陽性結果越有力(>10 算強),LR− 越小陰性結果越能排除(<0.1 算強)。優點是不受盛行率影響,可跨場域比較工具。
校準 calibration
預測機率跟實際發生率對不對得起來——模型說這群人有七成風險,實際是不是真的七成發生。跟區辨力(AUC)是兩回事:排序排得對不代表機率報得準。預測模型兩者都要驗。
內部/外部驗證 internal / external validation
★ 內部驗證用同一批資料驗(交叉驗證、bootstrap),外部驗證換一批人、換個場域驗。只做內部驗證一定高估表現——模型記住了自己資料的巧合。工具要能上臨床,外部驗證是必經之路。