t-тест Стьюдента застосовується, коли потрібно перевірити, чи є різниця між середніми двох груп (або між середнім вибірки та певним еталонним значенням) статистично значущою, чи скоріше могла виникнути випадково — результатом тесту є t-статистика та p-значення, на основі яких приймається рішення про відхилення чи відсутність підстав для відхилення нульової гіпотези.
Три типи t-тесту
- t-тест для однієї вибірки — порівнює середнє вибірки з встановленим еталонним значенням (наприклад, чи середній час доставки істотно відрізняється від заявлених 24 годин).
- t-тест для незалежних вибірок — порівнює середні двох окремих, незалежних груп (наприклад, результати тестової і контрольної груп в експерименті).
- t-тест для залежних (парних) вибірок — порівнює два вимірювання, виконані на тих самих об'єктах, наприклад, до і після втручання (наприклад, вагу учасників до і після дієтичної програми).
Коли t-тест є правильним вибором
t-тест Стьюдента доречний, коли дані приблизно відповідають нормальному розподілу (або вибірка достатньо чисельна, щоб центральна гранична теорема це нівелювала), а змінна кількісна (безперервна). При порівнянні більш ніж двох груп застосовується дисперсійний аналіз (ANOVA), а не численні t-тести, оскільки численні порівняння підвищують ризик статистичної похибки першого роду.
Формула та інтерпретація t-статистики
Для t-тесту незалежних вибірок t-статистика обчислюється спрощено як різниця середніх обох груп, поділена на стандартну похибку цієї різниці. Чим більше абсолютне значення t-статистики (при заданій кількості ступенів свободи), тим менша ймовірність (p-значення), що спостережувана різниця виникла випадково. Загальноприйнятий поріг значущості — p < 0,05 — нижче цього значення різницю вважають статистично значущою.
Числовий приклад
Група А (10 осіб) досягла середнього результату 78 балів (стандартне відхилення 6), а група Б (10 осіб) — середнього результату 72 бали (стандартне відхилення 7) у тому самому тесті. Після підстановки у формулу t-тесту для незалежних вибірок отримано t-статистику ≈ 2,05, що при 18 ступенях свободи відповідає p-значенню ≈ 0,055. Оскільки p-значення трохи вище порогу 0,05, різниця між групами близька до статистичної значущості, але формально не досягає стандартного порогу — потрібна більша вибірка, щоб однозначно підтвердити ефект.
Щоб швидко розрахувати t-статистику і p-значення для власних даних, скористайтеся готовим інструментом: Калькулятор t-тесту →
Найпоширеніші запитання про t-тест Стьюдента
Коли застосовувати t-тест Стьюдента?
t-тест застосовується, щоб перевірити, чи різниця між середніми двох груп чи між середнім вибірки та еталонним значенням є статистично значущою, при даних, близьких до нормального розподілу.
Яка різниця між t-тестом для незалежних і залежних вибірок?
Тест для незалежних вибірок порівнює дві окремі групи, тоді як тест для залежних (парних) вибірок порівнює два вимірювання на тих самих об'єктах, наприклад, до і після втручання.
Що означає p-значення нижче 0,05 у t-тесті?
Це означає, що ймовірність спостереження такої чи більшої різниці між групами за умови відсутності реальної різниці (нульова гіпотеза) менша за 5%, що загалом вважається статистично значущим.
Чи можна застосовувати t-тест для порівняння більш ніж двох груп?
Ні, для порівняння більш ніж двох груп одночасно застосовується дисперсійний аналіз (ANOVA), оскільки численні t-тести підвищують ризик хибнопозитивних результатів.
Що якщо дані не мають нормального розподілу?
При явному відхиленні від нормального розподілу і малій вибірці кращим вибором може бути непараметричний тест, наприклад, U-тест Манна-Уітні замість t-тесту для незалежних вибірок.
Що таке ступені свободи в t-тесті?
Ступені свободи визначають кількість незалежної інформації, доступної для оцінки мінливості, і залежать від чисельності вибірки (груп) — вони впливають на форму t-розподілу та поріг значущості t-статистики.
Чи статистична значущість означає практичну значущість?
Не завжди — при дуже великих вибірках навіть незначні, практично неважливі різниці можуть досягти статистичної значущості, тому варто дивитися також на розмір ефекту, а не лише на p-значення.
Як розмір вибірки впливає на результат t-тесту?
Більша вибірка збільшує статистичну потужність тесту, тобто здатність виявити реальну різницю, якщо така існує, і зменшує ширину довірчого інтервалу для оціненої різниці середніх.
Що таке парний t-тест і коли його використовувати?
Парний t-тест порівнює різниці між двома пов'язаними вимірюваннями на тих самих одиницях (наприклад, до і після), що підвищує потужність тесту завдяки усуненню міжособистісної мінливості.
Чи однобічний t-тест відрізняється від двобічного?
Так, двобічний тест перевіряє, чи середні відрізняються в будь-якому напрямку, а однобічний тест перевіряє різницю лише в одному, заздалегідь заданому напрямку, що змінює спосіб обчислення p-значення.