Множественный регрессионый анализ
Построение уравнения множественной регрессии начинается с решения вопроса о спецификации модели, который в свою очередь включает 2 круга вопросов: отбор факторов и выбор уравнения регрессии.Отбор факторов обычно осуществляется в два этапа:
1) теоретический анализ взаимосвязи результата и круга факторов, которые оказывают на него существенное влияние;
2) количественная оценка взаимосвязи факторов с результатом. При линейной форме связи между признаками данный этап сводится к анализу корреляционной матрицы (матрицы парных линейных коэффициентов корреляции):
ry,yry,x1 ryx2 .... ry,xm
rx1,y rx1,x2rx2x2 .... rx2,xm
......
rxm,y rxm,x1rxm,x2 .... rxm,xm
где ry,xj– линейный парный коэффициент корреляции, измеряющий тесноту связи между признаками yихjj=1;m, m -число факторов.
rxj,xk– линейный парный коэффициент корреляции, измеряющий тесноту связи между признаками хjихkj,k =1;m.
Факторы, включаемые во множественную регрессию, должны отвечать следующим требованиям:
1. Они должны быть количественно измеримы. Если необходимо включить в модель качественный фактор, не имеющий количественного измерения, то ему нужно придать количественную определенность (например, в модели урожайности качество почвы задается в виде баллов).
2. Каждый фактор должен быть достаточно тесно связан с результатом (т.е. коэффициент парной линейной корреляции между фактором и результатом должен быть существенным).
3. Факторы не должны быть сильно коррелированы друг с другом, тем более находиться в строгой функциональной связи (т.е. они не должны быть интеркоррелированы). Разновидностью интеркоррелированности факторов является мультиколлинеарность - тесная линейная связь между факторами.
Мультиколлинеарность может привести к нежелательным последствиям:
1) оценки параметров становятся ненадежными. Они обнаруживают большие стандартные ошибки. С изменением объема наблюдений оценки меняются (не только по величине, но и по знаку), что делает модель непригодной для анализа и прогнозирования.
2) затрудняется интерпретация параметров множественной регрессии как характеристик действия факторов в «чистом» виде, ибо факторы коррелированны; параметры линейной регрессии теряют экономический смысл;
3) становится невозможным определить изолированное влияние факторов на результативный показатель.
Мультиколлинеарность имеет место, если определитель матрицы межфакторной корреляции близок к нулю:
.
Если же определитель матрицы межфакторной корреляции близок к единице, то мультиколлинеарности нет.Существуют различные подходы преодоления сильной межфакторной корреляции. Простейший из них – исключение из модели фактора (или факторов), в наибольшей степени ответственных за мультиколлинеарность при условии, что качество модели при этом пострадает несущественно (а именно, теоретический коэффициент детерминации -R2y(x1...xm) снизится несущественно).
Определение факторов, ответственных за мультиколлинеарность, может быть основано на анализе матрицы межфакторной корреляции. При этом определяют пару признаков-факторов, которые сильнее всего связаны между собой (коэффициент линейной парной корреляции максимален по модулю). Из этой пары в наибольшей степени ответственным за мультиколлинеарность будет тот признак, который теснее связан с другими факторами модели (имеет более высокие по модулю значения коэффициентов парной линейной корреляции).
Еще один способ определения факторов, ответственных за мультиколлинеарность основан на вычислении коэффициентов множественной детерминации (R2xj(x1,...,xj-1,xj+1,...,xm)), показывающего зависимость фактора xj от других факторов модели x1,...,xj-1, xj+1,...,xm. Чем ближе значение коэффициента множественной детерминации к единице, тем больше ответственность за мультиколлинеарность фактора, выступающего в роли зависимой переменной. Сравнивая между собой коэффициенты множественной детерминации для различных факторов можно проранжировать переменные по степени ответственности за мультиколлинеарность.
При выборе формы уравнения множественной регрессии предпочтение отдается линейной функции:
yi =a+b1·x1i+ b2·x2i+...+ bm·xmi+ui
в виду четкой интерпретации параметров.
Данное уравнение регрессии называют уравнением регрессии в естественном (натуральном) масштабе. Коэффициент регрессии bjпри факторе хjназывают условно-чистым коэффициентом регрессии. Он измеряет среднее по совокупности отклонение признака-результата от его средней величины при отклонении признака-фактора хj на единицу, при условии, что все прочие факторы модели не изменяются (зафиксированы на своих среднихуровнях).
Если не делать предположения о значениях прочих факторов, входящих в модель, то это означало бы, что каждый из них при изменении хj также изменялся бы (так как факторы связаны между собой), и своими изменениями оказывали бы влияние на признак-результат.
Расчет параметров уравнения линейной множественной регрессии
Параметры уравнения множественной регрессии можно оценить методом наименьших квадратов, составив и решив систему нормальных линейных уравнений.Кроме того, для линейной множественной регрессии существует другой способ реализации МНК при оценке параметров - через b-коэффициенты (через параметры уравнения регрессии в стандартных масштабах).
Модель регрессии в стандартном масштабе предполагает, что все значения исследуемых признаков переводятся в стандарты (стандартизованные значения) по формулам:
, j=1;m,
где хji- значение переменной хji в i-ом наблюдении.
.
Таким образом, начало отсчета каждой стандартизованной переменной совмещается с ее средним значением, а в качестве единицы изменения принимается ее среднее квадратическое отклонение s. Если связь между переменными в естественном масштабе линейная, то изменение начала отсчета и единицы измерения этого свойства не нарушат, так что и стандартизованные переменные будут связаны линейным соотношением:
.
Для оценки β-коэффициентов применим МНК. При этом система нормальных уравнений будет иметь вид:
rx1y=b 1+rx1x2∙b2+…+ rx1xm∙bm
rx2y= rx2x1∙b1+b2+…+ rx2xm∙bm
…
rxmy=rxmx1∙b1+rxmx2∙b2+…+bm
Найденные из данной системы b–коэффициенты позволяют определить значения коэффициентов в регрессии в естественном масштабе по формулам:
, j=1;m;
.
Показатели тесноты связи факторов с результатом.
Если факторные признаки различны по своей сущности и (или) имеют различные единицы измерения, то коэффициенты регрессии bjпри разных факторах являются несопоставимыми. Поэтому уравнение регрессии дополняют соизмеримыми показателями тесноты связи фактора с результатом, позволяющими ранжировать факторы по силе влияния на результат. К таким показателям тесноты связи относят: частные коэффициенты эластичности, b–коэффициенты, частные коэффициенты корреляции.
Частные коэффициенты эластичности Эj рассчитываются по формуле:
. Частный коэффициент эластичности показывают, на сколько процентов в среднем изменяется признак-результат y с изменением признака-фактора хj на один процент от своего среднего уровня при фиксированном положении других факторов модели. В случае линейной зависимости Эj рассчитываются по формуле:
, где Стандартизированные частные коэффициенты регрессии - b-коэффициенты (bj) показывают, на какую часть своего среднего квадратического отклонения sу изменится признак-результат y с изменением соответствующего фактора хj на величину своего среднего квадратического отклонения (sхj) при неизменном влиянии прочих факторов (входящих в уравнение).
По коэффициентам эластичности и b -коэффициентам могут быть сделаны противоположные выводы. Причины этого: а) вариация одного фактора очень велика; б) разнонаправленное воздействие факторов на результат.
Коэффициент bj может также интерпретироваться как показатель прямого (непосредственного) влияния j-ого фактора (xj) на результат (y). Во множественной регрессии j-ый фактор оказывает не только прямое, но и косвенное (опосредованное) влияние на результат (т.е. влияние через другие факторы модели). Косвенное влияние измеряется величиной:
, где m-число факторов в модели. Полное влияние j-ого фактора на результат равное сумме прямого и косвенного влияний измеряет коэффициент линейной парной корреляции данного фактора и результата – rxj,y.
Коэффициент частной корреляции измеряет «чистое» влияние фактора на результат при устранении воздействия прочих факторов модели.
Для расчета частных коэффициентов корреляции могут быть использованы парные коэффициенты корреляции.
Для случая зависимости y от двух факторов можно вычислить 2 коэффициента частной корреляции:
,
(фактор х2 фиксирован).
(фактор х1 фиксирован).
Это коэффициенты частной корреляции 1-ого порядка (порядок определяется числом факторов, влияние которых устраняется).
Частные коэффициенты корреляции, рассчитанные по таким формулам изменяются от –1 до +1. Они используются не только для ранжирования факторов модели по степени влияния на результат, но и также для отсева факторов. При малых значениях ryxm/x1,x2…xm-1 нет смысла вводить в уравнение m-ый фактор, т.к. его чистое влияние на результат несущественно.
Коэффициенты множественной детерминации и корреляции характеризуют совместное влияние всех факторов на результат.
По аналогии с парной регрессией можно определить долю вариации результата, объясненной вариацией включенных в модель факторов (d2), в его общей вариации (s2y). Ее количественная характеристика – теоретический множественный коэффициент детерминации (R2y(x1,...,xm)). Для линейного уравнения регрессии данный показатель может быть рассчитан через b-коэффициенты, как:
.
Оценка значимости полученного уравнения множественной регрессии .
Оценка значимости уравнения множественной регрессии осуществляется путем проверки гипотезы о равенстве нулю коэффициент детерминации рассчитанного по данным генеральной совокупности:
Для ее проверки используют F-критерий Фишера.
При этом вычисляют фактическое (наблюдаемое) значение F-критерия, через коэффициент детерминации R2y(x1,...,xm), рассчитанный по данным конкретного наблюдения:
, где n-число наблюдений; h – число оцениваемых параметров (в случае двухфакторной линейной регрессии h=3).
По таблицам распределения Фишера-Снедоккора находят критическое значение F-критерия (Fкр). Для этого задаются уровнем значимости a (обычно его берут равным 0,05) и двумя числами степеней свободы k1=h-1 и k2=n-h.
Сравнивают фактическое значение F-критерия (Fнабл) с табличным Fкр(a;k1;k2). Если Fнабл<Fкр(a;k1;k2), то гипотезу о незначимости уравнения регрессии не отвергают. Если Fнабл>Fкр(a;k1;k2), то выдвинутую гипотезу отвергают и принимают альтернативную гипотезу о статистической значимости уравнения регрессии.
Частные коэффициенты эластичности
Частные коэффициенты эластичности определяются по формуле:где bi - коэффициент регрессии перед xi; xi - среднее значение фактора xi; y - среднее значение признака y.
Пример. 1. Оценка уравнения регрессии. Определим вектор оценок коэффициентов регрессии. Согласно методу наименьших квадратов, вектор получается из выражения:
s = (XTX)-1XTY
Матрица X
Можно также посмотреть, как было найдено решение аналогичного примера.
Матрица Y
Матрица XT
Умножаем матрицы, (XTX)
| 24 | 4459.4 | 1907.7 | 214.2 | 417.47 |
| 4459.4 | 907391.96 | 353017.36 | 40134.04 | 87383.93 |
| 1907.7 | 353017.36 | 152366.77 | 17041.58 | 33412.82 |
| 214.2 | 40134.04 | 17041.58 | 1921.32 | 3807 |
| 417.47 | 87383.93 | 33412.82 | 3807 | 8907.78 |
В матрице, (XTX) число 24, лежащее на пересечении 1-й строки и 1-го столбца, получено как сумма произведений элементов 1-й строки матрицы XT и 1-го столбца матрицы X
Умножаем матрицы, (XTY)
| 2743.3 |
| 557558.59 |
| 218286.47 |
| 24740.08 |
| 54488.32 |
Находим обратную матрицу (XTX)-1
| 67.5762 | -0.0883 | -0.4341 | -3.3069 | 0.7404 |
| -0.0883 | 0.0002 | 0.0006 | 0.0037 | -0.0012 |
| -0.4341 | 0.0006 | 0.0036 | 0.0134 | -0.0047 |
| -3.3069 | 0.0037 | 0.0134 | 0.2444 | -0.0358 |
| 0.7404 | -0.0012 | -0.0047 | -0.0358 | 0.01 |
Вектор оценок коэффициентов регрессии равен
s = (XTX)-1XTY =
| -55.01 |
| 0.43 |
| 0.86 |
| -1.14 |
| 0.95 |
Уравнение регрессии (оценка уравнения регрессии)
Y = -55.0117 + 0.4315X 1 + 0.8571X 2-1.1392X 3 + 0.9481X 4
2. Матрица парных коэффициентов корреляции.
Число наблюдений n = 24. Число независимых переменных в модели ровно 4, а число регрессоров с учетом единичного вектора равно числу неизвестных коэффициентов. С учетом признака Y, размерность матрицы становится равным 6. Матрица, независимых переменных Х имеет размерность (24 х 6). Матрица ХT Х определяется непосредственным умножением или по следующим предварительно вычисленным суммам.
Матрица составленная из Y и X
Транспонированная матрица.
Матрица ATA.
| 24 | 2743.3 | 4459.4 | 1907.7 | 214.2 | 417.47 |
| 2743.3 | 344649.05 | 557558.59 | 218286.47 | 24740.08 | 54488.32 |
| 4459.4 | 557558.59 | 907391.96 | 353017.36 | 40134.04 | 87383.93 |
| 1907.7 | 218286.47 | 353017.36 | 152366.77 | 17041.58 | 33412.82 |
| 214.2 | 24740.08 | 40134.04 | 17041.58 | 1921.32 | 3807 |
| 417.47 | 54488.32 | 87383.93 | 33412.82 | 3807 | 8907.78 |
| ∑n | ∑y | ∑x1 | ∑x2 | ∑x3 | ∑x4 |
| ∑y | ∑y2 | ∑x1·y | ∑x2·y | ∑x3·y | ∑x4·y |
| ∑x1 | ∑x1·y | ∑x12 | ∑x2·x1 | ∑x3·x1 | ∑x4·x1 |
| ∑x2 | ∑x2·y | ∑x2·x1 | ∑x22 | ∑x3·x2 | ∑x4·x2 |
| ∑x3 | ∑x3·y | ∑x3·x1 | ∑x3·x2 | ∑x32 | ∑x3·x4 |
| ∑x4 | ∑x4·y | ∑x4·x1 | ∑x4·x2 | ∑x4·x3 | ∑x42 |
Найдем парные коэффициенты корреляции.
Для y и x1
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для y и x2
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для y и x3
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для y и x4
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для x1 и x2
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для x1 и x3
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для x1 и x4
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для x2 и x3
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для x2 и x4
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Для x3 и x4
Уравнение имеет вид y = ax + b
Средние значения
Дисперсия
Среднеквадратическое отклонение
Коэффициент корреляции
Матрица парных коэффициентов корреляции.
| - | y | x1 | x2 | x3 | x4 |
| y | 1 | 0.97 | 0.05 | 0.47 | 0.95 |
| x1 | 0.97 | 1 | -0.19 | 0.38 | 0.86 |
| x2 | 0.05 | -0.19 | 1 | 0.18 | 0.21 |
| x3 | 0.47 | 0.38 | 0.18 | 1 | 0.65 |
| x4 | 0.95 | 0.86 | 0.21 | 0.65 | 1 |
Анализ первой строки этой матрицы позволяет произвести отбор факторных признаков, которые могут быть включены в модель множественной корреляционной зависимости. Факторные признаки, у которых ryxi < 0.5 исключают из модели.
Коллинеарность - зависимость между факторами. В качестве критерия мультиколлинеарности может быть принято соблюдение следующих неравенств:
r(xjy) > r(xkxj) ; r(xky) > r(xkxj).
Если одно из неравенств не соблюдается, то исключается тот параметр xk или xj, связь которого с результативным показателем Y оказывается наименее тесной.
3. Анализ параметров уравнения регрессии.
Перейдем к статистическому анализу полученного уравнения регрессии: проверке значимости уравнения и его коэффициентов, исследованию абсолютных и относительных ошибок аппроксимации
Для несмещенной оценки дисперсии проделаем следующие вычисления:
Несмещенная ошибка e = Y - X*s (абсолютная ошибка аппроксимации)
| 10.93 |
| 9.67 |
| 9.31 |
| 9.91 |
| 9.05 |
| 7.65 |
| 7.11 |
| 8.68 |
| 12.84 |
| 12.97 |
| 15.56 |
| 22.48 |
| 13.97 |
| 14.04 |
| 15.95 |
| 12.88 |
| 15.87 |
| 15.08 |
| 16.81 |
| 19.89 |
| 22.34 |
| 24.13 |
| 24.08 |
| 21.31 |
se2 = (Y - X*s)T(Y - X*s)
Несмещенная оценка дисперсии равна
Оценка среднеквадратичного отклонения равна
Найдем оценку ковариационной матрицы вектора k = σ*(XTX)-1
| 1183.8 | -1.55 | -7.6 | -57.93 | 12.97 |
| -1.55 | 0 | 0.01 | 0.06 | -0.02 |
| -7.6 | 0.01 | 0.06 | 0.23 | -0.08 |
| -57.93 | 0.06 | 0.23 | 4.28 | -0.63 |
| 12.97 | -0.02 | -0.08 | -0.63 | 0.17 |
Дисперсии параметров модели определяются соотношением S 2i = Kii, т.е. это элементы, лежащие на главной диагонали
С целью расширения возможностей содержательного анализа модели регрессии используются частные коэффициенты эластичности, которые определяются по формуле
Частные коэффициент эластичности E1 < 1. Следовательно, его влияние на результативный признак Y незначительно.
Частные коэффициент эластичности E2 < 1. Следовательно, его влияние на результативный признак Y незначительно.
Частные коэффициент эластичности E3 < 1. Следовательно, его влияние на результативный признак Y незначительно.
Частные коэффициент эластичности E4 < 1. Следовательно, его влияние на результативный признак Y незначительно.
Тесноту совместного влияния факторов на результат оценивает индекс множественной корреляции (от 0 до 1)
Связь между признаком Y факторами X сильная
Коэффициент детерминации
R 2= 0.9 2 = 0.81
т.е. в 81.2384 % случаев изменения х приводят к изменению y. Другими словами - точность подбора уравнения регрессии - высокая
Значимость коэффициента корреляции
По таблице Стьюдента находим Tтабл
Tтабл (n-m-1;a) = (19;0.05) = 1.729
Поскольку Tнабл > Tтабл , то отклоняем гипотезу о равенстве 0 коэффициента корреляции. Другими словами, коэффициента корреляции статистически - значим.
4. Оценка значения результативного признака при заданных значениях факторов.
Y(0.0,0.0,0.0,0.0,) = -55.01 + 0.4315 * 0.0 + 0.8571 * 0.0-1.1392 * 0.0 + 0.9481 * 0.0 = -55.01
Доверительные интервалы с вероятностью 0.95 для индивидуального значения результативного признака.
S2 = X0T(XTX)-1X0
где
X0T = [ 1 0.0 0.0 0.0 0.0]
(XTX)-1
| 67.5762 | -0.0883 | -0.4341 | -3.3069 | 0.7404 |
| -0.0883 | 0.0002 | 0.0006 | 0.0037 | -0.0012 |
| -0.4341 | 0.0006 | 0.0036 | 0.0134 | -0.0047 |
| -3.3069 | 0.0037 | 0.0134 | 0.2444 | -0.0358 |
| 0.7404 | -0.0012 | -0.0047 | -0.0358 | 0.01 |
X0
| 1 |
| 0 |
| 0 |
| 0 |
| 0 |
S2 = 67.58
(Y - t*SY ; Y + t*SY )
(-55.01 - 1.729*144.01 ; -55.01 + 1.729*144.01)
(-304;193.98)
Доверительные интервалы с вероятностью 0.95 для среднего значения результативного признака.
(-55.01 - 1.729*145.07 ; -55.01 + 1.729*145.07)
(-305.84;195.82)
5. Проверка гипотез относительно коэффициентов уравнения регрессии (проверка значимости параметров множественного уравнения регрессии).
1) t-статистика
Статистическая значимость коэффициента регрессии b0 не подтверждается
Статистическая значимость коэффициента регрессии b1 подтверждается
Статистическая значимость коэффициента регрессии b2 подтверждается
Статистическая значимость коэффициента регрессии b3 не подтверждается
Статистическая значимость коэффициента регрессии b4 подтверждается
Доверительный интервал для коэффициентов уравнения регрессии
Определим доверительные интервалы коэффициентов регрессии, которые с надежность 95% будут следующими:
(bi - t i S i; bi + t i S i)
b 0: (-114.5003;4.477)
b 1: (0.3419;0.521)
b 2: (0.4234;1.2908)
b 3: (-4.7171;2.4386)
b 4: (0.2255;1.6707)
2) F-статистика. Критерий Фишера
Fkp = 2.74
Поскольку F > Fkp, то коэффициент детерминации статистически значим и уравнение регрессии статистически надежно
6. Проверка на наличие гетероскедастичности методом графического анализа остатков.
В этом случае по оси абсцисс откладываются значения объясняющей переменной Xi, а по оси ординат квадраты отклонения ei2.