Параметричні методи: основні визначення, види, аналіз
Параметричні методи широко використовуються в математичній статистиці та аналізі даних. Вони дозволяють оцінювати невідомі параметри розподілу та перевіряти статистичні гіпотези про властивості даних. На відміну від непараметричних, ці методи припускають, що вид розподілу відомий і визначається кінцевим числом параметрів. Правильне застосування параметричних методів дає точніші результати, ніж непараметричні. Але для цього потрібно достеменно знати розподіл даних. Які існують основні види параметричних методів та критеріїв? Де їх можна використовувати? У цій статті ми розберемо теорію та практику використання параметричних методів у статистиці.
Основні визначення параметричних методів
Параметричні методи статистики базуються на припущенні, що генеральна сукупність, з якої отримано вибірку, має параметричний розподіл. Це означає, що розподіл описується кінцевим числом параметрів.
Наприклад, нормальний розподіл задається двома параметрами - математичним очікуванням та дисперсією. Біноміальний розподіл - параметрами n та p.
Параметричний метод відноситься до методів, що використовують апріорну інформацію про вид розподілу випадкової величини.
Основні передумови параметричних методів:
- Відомий вид розподілу генеральної сукупності (нормальний, біномний і т.д.)
- Параметри розподілу невідомі та підлягають оцінці
- Обсяг вибірки досить великий
За виконання цих умов параметричні методи дають більш точні результати, ніж непараметричні. Але вони дуже чутливі до порушення передумов.
Області застосування параметричних методів
Параметричні методи широко використовуються в різних галузях:
- Математична статистика
- Економетрика
- Психологія та педагогіка
- Медична статистика
- Соціологія
- Фінансовий та економічний аналіз
- Інші прикладні області
Розглянемо застосування параметричних методів у деяких сферах.
Психологія та педагогіка
У психології параметричні методи дають змогу аналізувати результати тестувань, опитувань, експериментів. Наприклад, порівнювати успішність у контрольній та експериментальній групах. Або оцінювати ефективність методик розвитку пам'яті, уваги.
Педагоги можуть оцінювати засвоєння матеріалу після різних методик викладання. Порівнювати рівень знань у різних класах чи регіонах.
Медична статистика
У медицині параметричні методи використовуються для обробки результатів клінічних досліджень. Наприклад, порівняння ефективності двох методів лікування. Оцінка впливу препарату на вибір пацієнтів. Аналіз факторів ризику хвороб.
За умови дотримання умов параметричні тести дають більш надійні результати і вимагають меншого обсягу вибірки.
Далі розглянемо докладніше основні види параметричних методів.
Основні види параметричних методів
Розглянемо найпоширеніші види параметричних методів.
Одним із основних методів оцінки невідомих параметрів розподілу є метод максимальної правдоподібності. Суть його полягає в тому, щоб знайти такі значення параметрів, при яких дані, що спостерігаються, мали б найбільшу ймовірність.
Формально вирішується завдання максимізації функції правдоподібності за невідомими параметрами.Цей метод має хороші статистичні властивості: спроможність, асимптотична нормальність і ефективність.
Широко використовується з метою оцінки невідомих коефіцієнтів в регресійних моделях. Суть методу – мінімізувати суму квадратів відхилень передбачених значень від фактичних.
Має високу точність оцінок, якщо виконані передумови (нормальність залишків, відсутність мультиколлінеарності).
Заснований на прирівнюванні теоретичних та вибіркових моментів розподілу. Наприклад, для нормального розподілу це математичне очікування та дисперсія.
Простий у реалізації, але менш ефективний, ніж метод максимальної правдоподібності.
Дозволяє враховувати апріорну інформацію про параметри. На її основі будується апостеріорний розподіл параметрів.
Дає точніші оцінки за наявності додаткових знань. Але обчислювально складніше класичних методів.
Це різновид методу найменших квадратів. Замість суми квадратів мінімізується сума відхилень модулів.
Більш стійкий до викидів даних. Не завжди має явне рішення.
Параметричні критерії перевірки гіпотез
Для перевірки статистичних гіпотез щодо параметрів розподілу використовуються параметричні критерії.
Дозволяє перевірити гіпотезу про рівність середніх у двох нормальних сукупностях або про рівність середнього заданого значення.
Використовується для перевірки рівності дисперсій у двох нормальних сукупностях.
Перевіряє гіпотезу про належність даних до конкретного виду розподілу (нормального, рівномірного та ін.).
Далі наведемо приклад використання параметричних методів.
Приклад аналізу даних із використанням параметричних методів
Розглянемо застосування параметричних методів реальному прикладі.
Нехай є дані про зростання двох груп студентів-першокурсників. Необхідно з'ясувати, чи є статистично значущі відмінності у середньому зростанні цих груп.
Спочатку перевіримо передумови для застосування параметричних методів:
- Обсяг вибірок досить великий (у кожній групі по 50 студентів)
- Дані мають приблизно нормальний розподіл (за гістограмами і тестами)
Передумови виконані, можна використовувати параметричний критерій.
Вибір методу
Для перевірки відмінностей середніх відповідає критерій Стьюдента для незалежних вибірок.
За даними вибірок розрахуємо значення критерію Стьюдента. Отримане значення можна порівняти з критичним.
Критичне значення при заданому рівні значущості 5% та числі ступенів свободи 98 дорівнює 1.98. Так як розрахункове значення критерію вище за критичний, нульова гіпотеза відкидається.
Середнє зростання двох груп статистично значимо відрізняється за рівня значимості 5%.
Параметричний критерій Стьюдента дозволив коректно оцінити відмінності середніх у двох вибірках. Для надійності результати має сенс перевіряти ще раз непараметричним критерієм Манна-Уітні.
Таким чином, параметричні методи за дотримання передумов дають обґрунтовані статистичні висновки.
Переваги параметричних методів
Розглянемо основні переваги параметричних методів:
При дотриманні передумов параметричні оцінки та критерії є заможними, незміщеними та ефективними. Вони дають мінімальну дисперсію помилки.
Існує широкий набір параметричних методів та критеріїв для вирішення різних статистичних завдань.
Параметричні критерії мають більшу потужність порівняно з непараметричними. Вони краще виявляють значні ефекти.
Результати параметричного аналізу простіше піддаються змістовної інтерпретації, оскільки пов'язані з конкретними параметрами розподілу.
Недоліки та обмеження
У параметричних методів також є деякі недоліки:
Порушення передумов про вид розподілу та обсяг вибірки може призвести до невірних результатів.
Для надійності оцінок потрібні досить великі вибірки (правило «чим більше, тим краще»).
Деякі параметричні методи вимагають значних обчислювальних витрат (метод максимальної правдоподібності).
Рекомендації щодо застосування
Щоб використовувати переваги параметричних методів, слід:
- Перевіряти передумови та переконуватись у їх виконанні
- Використовувати досить великі вибірки (понад 30 елементів)
- Вибирати найбільш підходящий метод під конкретне завдання
- За можливості порівнювати з непараметричними методами
За дотримання цих правил параметричні методи дають надійні статистичні висновки.
Тенденції розвитку параметричних методів
Розглянемо основні тенденції та напрямки розвитку параметричних методів у статистиці та аналізі даних:
Розробляються робасні версії параметричних оцінок та критеріїв, стійкі до порушення передумов та викидів у даних.
Відбувається розвиток байєсовського підходу, що дозволяє гнучко включати апріорну інформацію параметричні моделі.
Розробляються методи оцінки щільності та регресії, що не накладають жорстких обмежень на вигляд розподілу.
Йде інтеграція параметричних моделей з алгоритмами машинного навчання, що підвищують їхню гнучкість.
Зростання обчислювальних потужностей розширює можливості застосування ресурсомістких параметричних методів.
Актуальні проблеми та завдання
Основними проблемами та завданнями в галузі параметричних методів є:
- Підвищення роботності та стійкості методів
- Розробка ефективних чисельних алгоритмів
- Облік невизначеності вихідних даних
- Адаптація методів під завдання Big Data
- Інтеграція з методами штучного інтелекту
Їхнє рішення відкриває нові перспективи застосування параметричних підходів в аналізі даних та моделюванні складних процесів.
Параметричні та непараметричні процедури статистичного аналізу даних
Розглянута вище загальна стратегія оцінки статистичних гіпотез насамперед визначає застосування про параметричних методів математичної статистики.
Параметричні методи засновані на деяких, як правило, цілком ймовірних припущення про характер розподілу випадкової величини. Зазвичай параметричні методи, що використовуються в аналізі експериментальних даних, ґрунтуються на припущенні нормальності розподілу цих даних. Наслідком такого припущення є необхідність оцінки параметрів розподілу, що досліджуються. Так, у випадку, що розглядається далі t-тесту Стьюдента такими параметрами, що оцінюються, є математичне очікування і дисперсія. У ряді випадків робляться додаткові припущення щодо того, як параметри, що характеризують розподіл випадкової величини в різних вибірках, співвідносяться між собою. Так, у тесті Стьюдента, який часто використовують для порівняння середніх значень (математичного очікування) двох рядів даних щодо їх однорідності або неоднорідності, додатково робиться припущення про однорідність дисперсій розподілу випадкових величин у двох генеральних сукупностях, з яких ці дані були вилучені.
Перевагою методів параметричного аналізу даних є той факт, що вони мають досить високу потужність. Під потужністю тесту мають на увазі його здатність уникати помилок другого роду, або β-помилки. Чим менше виявляється β-помилка, тим вища потужність тесту. Інакше кажучи, потужність тесту = 1 – β.
Висока потужність параметричних тестів, або критеріїв, обумовлена тим, що дані методи вимагають, щоб дані були описані в метричній шкалі. Як відомо, до метричних шкал відносять інтервальну шкалу та шкалу відносин, яку іноді ще називають абсолютною шкалою. Інтервальна шкала дозволяє досліднику з'ясувати як відносини рівності чи нерівності елементів вибірки (як і дозволяє зробити шкала найменувань) і не тільки відносини порядку (як це дозволяє зробити шкала порядку), але й оцінювати еквівалентність інтервалів. Абсолютна шкала на додаток до цього дозволяє оцінювати еквівалентність відносин між елементами множини, отриманими в ході вимірювання. Саме тому метричні шкали відносять до сильних вимірювальних шкал. Завдяки цій силі параметричні методи дозволяють точніше висловити відмінності у розподілі випадкової величини за умови істинності кульових або альтернативних гіпотез.
Слід зазначити, що загалом параметричні методи статистики більш розроблені теорії математичної статистики і тому застосовуються значно ширше. Практично будь-який експериментальний результат може бути оцінений за допомогою будь-якого з цих методів. Саме такі методи і розглядаються переважно у підручниках та посібниках зі статистичного аналізу даних.
У той самий час труднощі, пов'язані з використанням методів параметричного аналізу у статистиці, у тому, що у ряді випадків апріорні припущення характері розподілу досліджуваних випадкових величин може бути неправильними. І ці випадки дуже характерні саме для психологічних досліджень у тих чи інших ситуаціях.
Так, якщо порівнювати дві вибірки за допомогою t-Тесту Стьюдента, можна виявити, що розподіл наших даних відрізняється від нормального, а дисперсії у двох вибірках значно відрізняються. У цьому випадку використання параметричного тесту Стьюдента може певною мірою спотворити висновки, які хоче зробити дослідник. Така небезпека збільшується, якщо значення обчисленої статистики виявляються близькими до граничних значень квантилей, які використовуються для прийняття або заперечення гіпотез. У більшості випадків, однак, як, наприклад, у разі використання t-Теста, деякі відхилення від теоретично заданих припущень виявляються некритичними для надійного статистичного висновку. В інших випадках такі відхилення можуть становити серйозну загрозу такому висновку. Тоді дослідники можуть розробляти спеціальні процедури, які можуть скоригувати процедуру ухвалення рішення щодо істинності статистичних гіпотез. Призначення цих процедур полягає в тому, щоб обійти або пом'якшити занадто жорсткі вимоги параметричних моделей статистики, що використовується.
Один з варіантів таких дій дослідника, коли він виявляє, що отримані ним дані за своїми параметрами відрізняються від того, що задано в структурній моделі параметричного тесту, що використовується, може полягати в тому, щоб спробувати перетворити ці дані до потрібного вигляду. Наприклад, як у гол.1, вимірюючи час реакції, можна уникнути високого значення асиметрії його розподілу, якщо використовувати для аналізу логарифми одержуваних значень, а не значення часу реакції.
Інший варіант дій полягає у відмові від використання будь-яких апріорно заданих припущень про характер розподілу випадкової величини в генеральній сукупності. А це означає відмову від параметричних методів математичної статистики на користь непараметричних.
Непараметричними називають методи математичної статистики, у яких не висуваються будь-які апріорні припущення про характер розподілу досліджуваних даних і передбачається будь-яких припущень про співвідношення параметрів розподілу аналізованих величин. У цьому полягає головна перевага цих методів.
Повною мірою перевага непараметричної статистики розкривається тоді, коли результати, отримані в експерименті, виявляються представленими у слабкішій неметричній шкалі, являючи собою результати ранжирування. Така шкала називається шкалою порядку. Звичайно, у ряді випадків дослідник може перетворити ці дані до сильнішої інтервальної шкали, використовуючи процедури нормалізації даних, але, як правило, оптимальним варіантом у цій ситуації є застосування непараметричних тестів, спеціально створених для статистичного аналізу.
Як правило, тести непараметричної статистики припускають оцінювання наявних співвідношень рангових сум у двох або більше вибірках, і на підставі цього формулюється висновок про співвідношення цих вибірок. Прикладами таких тестів є критерій знаків, критерій знакових рангів Вілкоксона, а також U-критерій Манна – Вітні, які використовуються як аналог параметричного t-тесту Стьюдента.
У той же час, якщо результати вимірювання виявляються представленими у сильнішій шкалі, використання непараметричної статистики означає відмову від частини інформації, що міститься в даних. Наслідком є небезпека зростання помилки другого роду, властивої цим методам.
Таким чином, методи непараметричної статистики виявляються консервативнішими порівняно з методами параметричної статистики. Їх використання загрожує переважно помилкою другого роду, тобто. ситуацією, коли дослідник, наприклад, неспроможна виявити відмінності двох вибірок, коли такі відмінності насправді мають місце. Інакше кажучи, такі методи виявляються менш потужними проти параметричними методами. Тому використання параметричної статистики в аналізі експериментальних даних, що відрізняються від простого ранжирування, як правило, є кращим.
Параметричний аналіз даних
Параметричний аналіз даних - Математичний підхід, що використовується для визначення параметрів статистичної моделі на основі даних. Це дозволяє нам отримати більш точну інформацію про характеристики вибірки та визначити, наскільки можливі результати нашої моделі. На відміну від параметричного аналізу, непараметричний аналіз не передбачає будь-яких розподілених параметрів та не використовує жодних додаткових умов.
Параметричний аналіз широко використовується у різних галузях, включаючи економіку, науку та інженерію. Методи параметричного аналізу можуть бути застосовані для будь-якого виду даних, включаючи якісні та кількісні.
Ключова перевага параметричного аналізу полягає в тому, що він може забезпечити більше точні результати в порівнянні з непараметричним аналізом, особливо у випадках, коли дані відповідають певним параметричним моделям.
Основні поняття
- Нормальний розподіл - використовується для опису змінних, які мають безперервний розподіл. Він характеризується середнім значенням та стандартним відхиленням.
- Біноміальний розподіл - Використовується для опису бінарних (двійкових) змінних, таких як успіх/невдача.
- Пуассонівський розподіл - використовується для опису випадкових подій, які відбуваються з певною інтенсивністю.
- Рівномірний розподіл - використовується для опису змінних, які мають рівномірний розподіл за всіма можливими значеннями. Він характеризується мінімальним та максимальним значенням.
Приклад оцінки параметрів у параметричному аналізі може бути пов'язаний з оцінкою середнього значення та дисперсії при порівнянні двох вибірок. Наприклад, дослідники хочуть оцінити відмінності у середній тривалості роботи між чоловіками та жінками у компанії. , щоб оцінити параметри розподілу кожної вибірки і порівняти їх.Якщо середні значення вибірок різняться значимо, всі вони можуть зробити висновок, що є різниця у тривалості роботи між чоловіками і жінками у компанії. Оцінки параметрів є ключовими кроками у цьому процесі та допомагають дослідникам зробити висновки на основі даних
Нульова гіпотеза — це припущення, що різницю між двома вибірками є випадковими. Альтернативна гіпотеза — це припущення, що різницю між вибірками є значущими. Параметричний аналіз використовує імовірнісні розподіли для перевірки цих гіпотез та прийняття рішень на їх основі.
Наприклад, дослідник може сформулювати нульову гіпотезу, що середнє час реакції двох груп людей певний стимул однаково, і будь-яке виявлене різницю між групами є результатом випадкових чинників.
- Середні значення двох вибірок дорівнюють.
- Дисперсії двох вибірок рівні.
- Дані розподілені нормально.
Параметричні методи аналізу даних
Пропонуємо розглянути кілька параметричних методів аналізу даних, які є найбільш поширеними та ефективними: T-тест Стьюдента, аналіз дисперсії (ANOVA) та лінійна регресія.
T-тест Стьюдента один із найпоширеніших параметричних методів аналізу даних. Він використовується для перевірки гіпотези про різницю середніх значень двох вибірок. T-тест Стьюдента заснований на оцінці t-статистики для різниці середніх значень двох вибірок. T-статистика розраховується як відношення різниці середніх значень до стандартної помилки різниці середніх значень. Якщо t-статистика більша від критичного значення, то відмінності між вибірками статистично значущі.
Приклад коду Python для T-тест Стьюдента:
import numpy as np from scipy import stats # згенеруємо дві вибірки sample1 = np.random.normal(loc=10, scale=2, size=20) sample2 = np.random.normal(loc=12, scale=2, size= 20) # проведемо T-тест Стьюдента t, p_value = stats.ttest_ind(sample1, sample2) # виведемо результати print("t-статистика =", t) print("p-value python">import pandas as pd import scipy.stats as stats import statsmodels.api as sm from statsmodels. formula.api import ols #створюємо кадр даних з результатами лікування data = df = pd.DataFrame(data) # використовуємо однофакторний ANOVA model = ols('value ~ C(treatment)', data=df).fit() (anova_table) #виводимо результати аналізу print("p-value: ", anova_table['PR(>F)'][0]) if anova_table['PR(>F)'][0] < 0.05: print("Відкидаємо нульову гіпотезу, статистично значущі відмінності між групами є") else: print( "Не відкидаємо нульову гіпотезу, статистично значимих відмінностей між групами немає")
Висновок: у цьому прикладі, p-value менше 0.05, що свідчить, що статистично значущі різницю між групами є. Ми можемо зробити висновок, що різні препарати мають різний вплив на зменшення болю в суглобах.
Лінійна регресія — це метод, який дозволяє визначити лінійну залежність між двома змінними: залежною (вивчається) та незалежною. Мета лінійної регресійної моделі – оцінити параметри лінійної залежності між цими змінними та побудувати рівняння прямої лінії, яка найкраще описує цю залежність.
- Прогнозування значень залежної змінної за значеннями незалежною
- Оцінка впливу однієї чи кількох незалежних змінних на залежну змінну
- Ідентифікація викидів та аномалій у даних
- Перевірка адекватності моделі
Приклад коду на Python для побудови моделі лінійної регресії:
import pandas as pd import numpy as np import matplotlib.pyplot as plt from sklearn.linear_model import LinearRegression # створюємо вихідні дані - дві змінні x = np.array([1, 2, 3, 4, 5]) y = np.array ([2, 4, 5, 7, 8]) # створюємо модель лінійної регресії model = LinearRegression() # навчаємо модель на вихідних даних x = x.reshape(-1, 1) model.fit(x, y) # виводимо результати моделі print('Коефіцієнти моделі: ', model.coef_) print ('Перетин: ', model.intercept_) print('R-квадрат: %.4f' % model.score(x, y)) # будуємо графік прямої лінії plt.scatter(x, y) plt.plot(x, model.predict(x), color='red') plt.show()
У цьому прикладі ми створюємо дві змінні і будуємо модель лінійної регресії. На виході ми отримуємо коефіцієнти лінійної залежності, перетин з віссю, значення R-квадрат (яке показує, наскільки добре модель підходить до даних) і будуємо графік прямої лінії, яка описує нашу модель.
Обмеження параметричного аналізи
Незважаючи на всі переваги, параметричний аналіз має обмеження. По-першевін вимагає наявності правильно підібраних параметрів. Якщо проектувальник не визначить параметри, які мають бути змінені, процес параметричного аналізу не матиме сенсу.
По-друге, параметричний аналіз може некоректно працювати, якщо порушено правила щодо параметрів. Це може статися, коли два або більше параметрів взаємозалежні один від одного. Якщо один параметр зміниться, це призведе до зміни іншого параметра і, як наслідок, до некоректного результату в параметрическом аналізі.
По-третє, параметричний аналіз жорстко обмежений програмним забезпеченням. Якщо програма, яка використовується для проведення аналізу, не може працювати з кількома параметрами одночасно, результати можуть бути неповними або некоректними.
Незважаючи на обмеження, параметричний аналіз — це ефективний інструмент підвищення ефективності проекту та його конкурентоспроможності.
Порівняння параметричного аналізу з непараметричним аналізом даних
Параметричний аналіз – це статистичний метод, який передбачає, що дані розподілені відповідно до відомого математичного розподілу, такого як нормальне. Інакше кажучи, параметричний аналіз вимагає знання параметрів, визначальних розподіл даних. Зазвичай такі параметри як середнє і стандартне відхилення використовуються визначення нормального розподілу даних.
Проте, який завжди можливо зробити висновки виходячи з параметричного аналізу. Наприклад, якщо дані сильно криві (skewed) або їх розподіл явно не нормальний, параметричний аналіз не поєднується з реальністю. У такій ситуації краще використати непараметричний аналіз даних.
Непараметричний аналіз даних не вимагає фіксованих параметрів розподілу, а ґрунтується на знанні про ранжування (rank) даних. Це корисно, якщо розподіл даних не віддає звіту про реальність даних.
Непараметричний аналіз може охоплювати безліч методів, включаючи тести на відповідність, незалежність та різницю між вибірками. Однак, залежно від конкретної ситуації, непараметричний аналіз може бути меншим, ніж параметричний аналіз.
Так, параметричний та непараметричний аналізи даних – це дві різні техніки статистичного аналізу, що використовуються для вивчення даних. Основна відмінність між ними полягає в тому, що параметричний аналіз передбачає, що дані розподілені з відомими параметрами, тоді як непараметричний аналіз не вимагає знання параметрів розподілу. При виборі методу статистичного аналізу необхідно розглянути конкретну ситуацію та тип даних, які ви маєте.
Висновок
Параметричний аналіз даних – потужний інструмент для аналізу даних, який може допомогти знаходити закономірності та передбачати майбутні значення. Однак важливо розуміти його обмеження та враховувати їх при застосуванні методу.
Насамкінець хочу порекомендувати вам безкоштовний вебінар «Шлях системного аналітика: куди рости далі сеньйора». Зареєструватися на вебінар можна за посиланням.