Методы исследования статистических данных. Расчет показателей рядов динамики осуществляется на основе сравнения их уровней. При этом возможны два способа сопоставления уровней динамического ряда. Сводка и группировка материалов статистического наблюдения

Объектом исследования в прикладной статистике являются статистические данные, полученные в результате наблюдений или экспериментов. Статистические данные - это совокупность объектов (наблюдений, случаев) и признаков (переменных), их характеризующих. Статистические методы анализа данных применяются практически во всех областях деятельности человека. Их используют всегда, когда необходимо получить и обосновать какие-либо суждения о группе (объектов или субъектов) с некоторой внутренней неоднородностью.

Статистические методы анализа данных, относящиеся к группе а), обычно называют методами прикладной статистики.

Числовые статистические данные - это числа, вектора, функции. Их можно складывать, умножать на коэффициенты. Поэтому в числовой статистике большое значение имеют разнообразные суммы. Математический аппарат анализа сумм случайных элементов выборки - это (классические) законы больших чисел и центральные предельные теоремы.

Статистический анализ данных, как правило, включает в себя целый ряд процедур и алгоритмов, выполняемых последовательно, параллельно или по более сложной схеме. В частности, можно выделить следующие этапы:

планирование статистического исследования;

организация сбора необходимых статистических данных по оптимальной или рациональной программе (планирование выборки, создание организационной структуры и подбор команды статистиков, подготовка кадров, которые будут заниматься сбором данных, а также контролеров данных и т.п.);

непосредственный сбор данных и их фиксация на тех или иных носителях (с контролем качества сбора и отбраковкой ошибочных данных по соображениям предметной области);

первичное описание данных (расчет различных выборочных характеристик, функций распределения, непараметрических оценок плотности, построение гистограмм, корреляционных полей, различных таблиц и диаграмм и т.д.),

оценивание тех или иных числовых или нечисловых характеристик и параметров распределений (например, непараметрическое интервальное оценивание коэффициента вариации или восстановление зависимости между откликом и факторами, т.е. оценивание функции),

проверка статистических гипотез (иногда их цепочек - после проверки предыдущей гипотезы принимается решение о проверке той или иной последующей гипотезы),

более углубленное изучение, т.е. применение различных алгоритмов многомерного статистического анализа, алгоритмов диагностики и построения классификации, статистики нечисловых и интервальных данных, анализа временных рядов и др.;

проверка устойчивости полученных оценок и выводов относительно допустимых отклонений исходных данных и предпосылок используемых вероятностно-статистических моделей, в частности, изучение свойств оценок методом размножения выборок;

применение полученных статистических результатов в прикладных целях (например, для диагностики конкретных материалов, построения прогнозов, выбора инвестиционного проекта из предложенных вариантов, нахождения оптимальных режима осуществления технологического процесса, подведения итогов испытаний образцов технических устройств и др.),

составление итоговых отчетов, в частности, предназначенных для тех, кто не является специалистами в статистических методах анализа данных, в том числе для руководства - "лиц, принимающих решения".

К методам относят:

Корреляционный анализ. Между переменными (случайными величинами) может существовать функциональная связь, проявляющаяся в том, что одна из них определяется как функция от другой. Но между переменными может существовать и связь другого рода, проявляющаяся в том, что одна из них реагирует на изменение другой изменением своего закона распределения. Такую связь называют стохастической. В качестве меры зависимости между переменными используется коэффициент корреляции (r), который изменяется в пределах от - 1 до +1. Если коэффициент корреляции отрицательный, это означает, что с увеличением значений одной переменной значения другой убывают. Если переменные независимы, то коэффициент корреляции равен 0 (обратное утверждение верно только для переменных, имеющих нормальное распределение). Но если коэффициент корреляции не равен 0 (переменные называются некоррелированными), то это значит, что между переменными существует зависимость. Чем ближе значение r к 1, тем зависимость сильнее. Коэффициент корреляции достигает своих предельных значений +1 или - 1, тогда и только тогда, когда зависимость между переменными линейная. Корреляционный анализ позволяет установить силу и направление стохастической взаимосвязи между переменными (случайными величинами).

Регрессионный анализ. В регрессионном анализе моделируется взаимосвязь одной случайной переменной от одной или нескольких других случайных переменных. При этом, первая переменная называется зависимой, а остальные - независимыми. Выбор или назначение зависимой и независимых переменных является произвольным (условным) и осуществляется исследователем в зависимости от решаемой им задачи. Независимые переменные называются факторами, регрессорами или предикторами, а зависимая переменная - результативным признаком, или откликом.

Если число предикторов равно 1, регрессию называют простой, или однофакторной, если число предикторов больше 1 - множественной или многофакторной. В общем случае регрессионную модель можно записать следующим образом:

y = f (x 1 , x 2 , …, x n),

где y - зависимая переменная (отклик), x i (i = 1,…, n) - предикторы (факторы), n - число предикторов.

Канонический анализ. Канонический анализ предназначен для анализа зависимостей между двумя списками признаков (независимых переменных), характеризующих объекты. Например, можно изучить зависимость между различными неблагоприятными факторами и появлением определенной группы симптомов заболевания, или взаимосвязь между двумя группами клинико-лабораторных показателей (синдромов) больного. Канонический анализ является обобщением множественной корреляции как меры связи между одной переменной и множеством других переменных.

Методы сравнения средних. В прикладных исследованиях часто встречаются случаи, когда средний результат некоторого признака одной серии экспериментов отличается от среднего результата другой серии. Так как средние это результаты измерений, то, как правило, они всегда различаются, вопрос в том, можно ли объяснить обнаруженное расхождение средних неизбежными случайными ошибками эксперимента или оно вызвано определенными причинами. Сравнение средних результата один из способов выявления зависимостей между переменными признаками, характеризующими исследуемую совокупность объектов (наблюдений). Если при разбиении объектов исследования на подгруппы при помощи категориальной независимой переменной (предиктора) верна гипотеза о неравенстве средних некоторой зависимой переменной в подгруппах, то это означает, что существует стохастическая взаимосвязь между этой зависимой переменной и категориальным предиктором.

Частотный анализ. Таблицы частот, или как еще их называют одновходовые таблицы, представляют собой простейший метод анализа категориальных переменных. Данный вид статистического исследования часто используют как одну из процедур разведочного анализа, чтобы посмотреть, каким образом различные группы наблюдений распределены в выборке, или как распределено значение признака на интервале от минимального до максимального значения. Кросстабуляция (сопряжение) - процесс объединения двух (или нескольких) таблиц частот так, что каждая ячейка в построенной таблице представляется единственной комбинацией значений или уровней табулированных переменных. Кросстабуляция позволяет совместить частоты появления наблюдений на разных уровнях рассматриваемых факторов.

Анализ соответствий. Анализ соответствий по сравнению с частотным анализом содержит более мощные описательные и разведочные методы анализа двухвходовых и многовходовых таблиц. Метод, так же, как и таблицы сопряженности, позволяет исследовать структуру и взаимосвязь группирующих переменных, включенных в таблицу.

Кластерный анализ. Кластерный анализ - это метод классификационного анализа; его основное назначение - разбиение множества исследуемых объектов и признаков на однородные в некотором смысле группы, или кластеры. Это многомерный статистический метод, поэтому предполагается, что исходные данные могут быть значительного объема, т.е. существенно большим может быть как количество объектов исследования (наблюдений), так и признаков, характеризующих эти объекты. Большое достоинство кластерного анализа в том, что он дает возможность производить разбиение объектов не по одному признаку, а по ряду признаков. Кроме того, кластерный анализ в отличие от большинства математико-статистических методов не накладывает никаких ограничений на вид рассматриваемых объектов и позволяет исследовать множество исходных данных практически произвольной природы.

Дискриминантный анализ. Дискриминантный анализ включает статистические методы классификации многомерных наблюдений в ситуации, когда исследователь обладает так называемыми обучающими выборками. Этот вид анализа является многомерным, так как использует несколько признаков объекта, число которых может быть сколь угодно большим. Цель дискриминантного анализ состоит в том, чтобы на основе измерения различных характеристик (признаков) объекта классифицировать его, т.е. отнести к одной из нескольких заданных групп (классов) некоторым оптимальным способом. При этом предполагается, что исходные данные наряду с признаками объектов содержат категориальную (группирующую) переменную, которая определяет принадлежность объекта к той или иной группе. Факторный анализ. Факторный анализ - один из наиболее популярных многомерных статистических методов. Если кластерный и дискриминантный методы классифицируют наблюдения, разделяя их на группы однородности, то факторный анализ классифицирует признаки (переменные), описывающие наблюдения. Поэтому главная цель факторного анализа - сокращение числа переменных на основе классификация переменных и определения структуры взаимосвязей между ними.

Деревья классификации. Деревья классификации - это метод классификационного анализа, позволяющий предсказывать принадлежность объектов к тому или иному классу в зависимости от соответствующих значений признаков, характеризующих объекты. Признаки называются независимыми переменными, а переменная, указывающая на принадлежность объектов к классам, называется зависимой. В отличие от классического дискриминантного анализа, деревья классификации способны выполнять одномерное ветвление по переменными различных типов категориальным, порядковым, интервальным. Не накладываются какие-либо ограничения на закон распределения количественных переменных. По аналогии с дискриминантным анализом метод дает возможность анализировать вклады отдельных переменных в процедуру классификации.

Анализ главных компонент и классификация. Метод анализ главных компонент и классификация позволяет решить эту задачу и служит для достижения двух целей:

уменьшение общего числа переменных (редукция данных) для того, чтобы получить "главные" и "некоррелирующие" переменные;

классификация переменных и наблюдений, при помощи строящегося факторного пространства.

Решение основной задачи метода достигается созданием векторного пространства латентных (скрытых) переменных (факторов) с размерностью меньше исходной. Исходная размерность определяется числом переменных для анализа в исходных данных.

Многомерное шкалирование. Метод можно рассматривать как альтернативу факторному анализу, в котором достигается сокращение числа переменных, путем выделения латентных (непосредственно не наблюдаемых) факторов, объясняющих связи между наблюдаемыми переменными. Цель многомерного шкалирования - поиск и интерпретация латентных переменных, дающих возможность пользователю объяснить сходства между объектами, заданными точками в исходном пространстве признаков. Показателями сходства объектов на практике могут быть расстояния или степени связи между ними. В факторном анализе сходства между переменными выражаются с помощью матрицы коэффициентов корреляций. В многомерном шкалировании в качестве исходных данных можно использовать произвольный тип матрицы сходства объектов: расстояния, корреляции и т.д.

Моделирование структурными уравнениями (причинное моделирование). Объектом моделирования структурными уравнениями являются сложные системы, внутренняя структура которых не известна ("черный ящик"). Основная идея моделирования структурными уравнениями состоит в том, что можно проверить, связаны ли переменные Y и X линейной зависимостью Y = aX, анализируя их дисперсии и ковариации. Эта идея основана на простом свойстве среднего и дисперсии: если умножить каждое число на некоторую константу k, среднее значение также умножится на k, при этом стандартное отклонение умножится на модуль k.

Временные ряды. Временные ряды - это наиболее интенсивно развивающееся, перспективное направление математической статистики. Под временным (динамическим) рядом подразумевается последовательность наблюдений некоторого признака Х (случайной величины) в последовательные равноотстоящие моменты t. Отдельные наблюдения называются уровнями ряда и обозначаются хt, t = 1, …, n. При исследовании временного ряда выделяются несколько составляющих:

x t =u t +y t +c t +e t , t = 1, …, n,

где u t - тренд, плавно меняющаяся компонента, описывающая чистое влияние долговременных факторов (убыль населения, уменьшение доходов и т.д.); - сезонная компонента, отражающая повторяемость процессов в течение не очень длительного периода (дня, недели, месяца и т.д.); сt - циклическая компонента, отражающая повторяемость процессов в течение длительных периодов времени свыше одного года; t - случайная компонента, отражающая влияние не поддающихся учету и регистрации случайных факторов. Первые три компоненты представляют собой детерминированные составляющие.

Нейронные сети. Нейронные сети представляют собой вычислительную систему, архитектура которой имеет аналогию с построением нервной ткани из нейронов. На нейроны самого нижнего слоя подаются значения входных параметров, на основании которых нужно принимать определенные решения.

Планирование экспериментов. Искусство располагать наблюдения в определенном порядке или проводить специально спланированные проверки с целью полного использования возможностей этих методов и составляет содержание предмета "планирование эксперимента".

Карты контроля качества. Качество продукции и услуг формируется в процессе научных исследований, конструкторских и технологических разработок, обеспечивается хорошей организацией производства и услуг. Но изготовление продукции и оказание услуг независимо от их вида всегда связано с определенным непостоянством условий производства и предоставления. Это приводит к некоторой вариабельности признаков их качества. Поэтому, актуальными являются вопросы разработки методов контроля качества, которые позволят своевременно выявить признаки нарушения технологического процесса или оказания услуг.

Различные единицы статистической совокупности, имеющие определенное сходство межу собой по достаточно важным признакам, объединяются в группы при помощи метода группировки. Такой прием позволяет "сжать" информацию, полученную в ходе наблюдения, и на этой основе установить закономерности, присущие изучаемому явлению.

Метод группировок применяется для решения различных задач, важнейшими из которых являются:

1. выделение социально-экономических типов

2. определение структуры однотипных совокупностей

3. вскрытие связей и закономерностей между отдельными признаками общественных явлений

В связи с этим существуют 3 вида группировок: типологические, структурные и аналитические. Группировки различают по форме проведения.

Типологическая группировка представляет собой разделение исследуемой качественно разнородной статистической совокупности на классы, социально-экономические типы, однородные группы единиц.

Структурные группировки разделяют однородную в качественном отношении совокупность единиц по определенным, существенным признакам на группы, характеризующие ее состав и внутреннюю структуру.

Аналитические группировки обеспечивают установление взаимосвязи и взаимозависимости между исследуемыми социально-экономическими явлениями и признаками, их характеризующими. Посредством этого вида группировок устанавливаются и изучаются причинно-следственные связи между признаками однородных явлений, определяются факторы развития статистической совокупности.

Статистические методы

Статисти́ческие ме́тоды - методы анализа статистических данных. Выделяют методы прикладной статистики , которые могут применяться во всех областях научных исследований и любых отраслях народного хозяйства, и другие статистические методы, применимость которых ограничена той или иной сферой. Имеются в виду такие методы, как статистический приемочный контроль, статистическое регулирование технологических процессов, надежность и испытания, планирование экспериментов.

Классификация статистических методов

Статистические методы анализа данных применяются практически во всех областях деятельности человека. Их используют всегда, когда необходимо получить и обосновать какие-либо суждения о группе (объектов или субъектов) с некоторой внутренней неоднородностью.

Целесообразно выделить три вида научной и прикладной деятельности в области статистических методов анализа данных (по степени специфичности методов, сопряженной с погруженностью в конкретные проблемы):

а) разработка и исследование методов общего назначения, без учета специфики области применения;

б) разработка и исследование статистических моделей реальных явлений и процессов в соответствии с потребностями той или иной области деятельности;

в) применение статистических методов и моделей для статистического анализа конкретных данных.

Прикладная статистика

Описание вида данных и механизма их порождения - начало любого статистического исследования. Для описания данных применяют как детерминированные, так и вероятностные методы. С помощью детерминированных методов можно проанализировать только те данные, которые имеются в распоряжении исследователя. Например, с их помощью получены таблицы, рассчитанные органами официальной государственной статистики на основе представленных предприятиями и организациями статистических отчетов. Перенести полученные результаты на более широкую совокупность, использовать их для предсказания и управления можно лишь на основе вероятностно-статистического моделирования. Поэтому в математическую статистику часто включают лишь методы, опирающиеся на теорию вероятностей.

Мы не считаем возможным противопоставлять детерминированные и вероятностно-статистические методы. Мы рассматриваем их как последовательные этапы статистического анализа. На первом этапе необходимо проанализировать имеющие данные, представить их в удобном для восприятия виде с помощью таблиц и диаграмм. Затем статистические данные целесообразно проанализировать на основе тех или иных вероятностно-статистических моделей. Отметим, что возможность более глубокого проникновения в суть реального явления или процесса обеспечивается разработкой адекватной математической модели.

В простейшей ситуации статистические данные - это значения некоторого признака, свойственного изучаемым объектам. Значения могут быть количественными или представлять собой указание на категорию, к которой можно отнести объект. Во втором случае говорят о качественном признаке.

При измерении по нескольким количественным или качественным признакам в качестве статистических данных об объекте получаем вектор. Его можно рассматривать как новый вид данных. В таком случае выборка состоит из набора векторов. Есть часть координат - числа, а часть - качественные (категоризованные) данные, то говорим о векторе разнотипных данных.

Одним элементом выборки, то есть одним измерением, может быть и функция в целом. Например, описывающая динамику показателя, то есть его изменение во времени, - электрокардиограмма больного или амплитуда биений вала двигателя. Или временной ряд, описывающий динамику показателей определенной фирмы. Тогда выборка состоит из набора функций.

Элементами выборки могут быть и иные математические объекты. Например, бинарные отношения. Так, при опросах экспертов часто используют упорядочения (ранжировки) объектов экспертизы - образцов продукции, инвестиционных проектов, вариантов управленческих решений. В зависимости от регламента экспертного исследования элементами выборки могут быть различные виды бинарных отношений (упорядочения, разбиения, толерантности), множества, нечеткие множества и т. д.

Итак, математическая природа элементов выборки в различных задачах прикладной статистики может быть самой разной. Однако можно выделить два класса статистических данных - числовые и нечисловые. Соответственно прикладная статистика разбивается на две части - числовую статистику и нечисловую статистику.

Нечисловые статистические данные - это категоризованные данные, вектора разнотипных признаков, бинарные отношения, множества, нечеткие множества и др. Их нельзя складывать и умножать на коэффициенты. Поэтому не имеет смысла говорить о суммах нечисловых статистических данных. Они являются элементами нечисловых математических пространств (множеств). Математический аппарат анализа нечисловых статистических данных основан на использовании расстояний между элементами (а также мер близости, показателей различия) в таких пространствах. С помощью расстояний определяются эмпирические и теоретические средние, доказываются законы больших чисел, строятся непараметрические оценки плотности распределения вероятностей, решаются задачи диагностики и кластерного анализа, и т. д. (см. ).

В прикладных исследованиях используют статистические данные различных видов. Это связано, в частности, со способами их получения. Например, если испытания некоторых технических устройств продолжаются до определенного момента времени, то получаем т. н. цензурированные данные, состоящие из набора чисел - продолжительности работы ряда устройств до отказа, и информации о том, что остальные устройства продолжали работать в момент окончания испытания. Цензурированные данные часто используются при оценке и контроле надежности технических устройств.

Обычно отдельно рассматривают статистические методы анализа данных первых трех типов. Это ограничение вызвано тем отмеченным выше обстоятельством, что математический аппарат для анализа данных нечисловой природы - существенно иной, чем для данных в виде чисел, векторов и функций.

Вероятностно-статистическое моделирование

При применении статистических методов в конкретных областях знаний и отраслях народного хозяйства получаем научно-практические дисциплины типа «статистические методы в промышленности», «статистические методы в медицине» и др. С этой точки зрения эконометрика - это «статистические методы в экономике». Эти дисциплины группы б) обычно опираются на вероятностно-статистические модели, построенные в соответствии с особенностями области применения. Весьма поучительно сопоставить вероятностно-статистические модели, применяемые в различных областях, обнаружить их близость и вместе с тем констатировать некоторые различия. Так, видна близость постановок задач и применяемых для их решения статистических методов в таких областях, как научные медицинские исследования, конкретные социологические исследования и маркетинговые исследования, или, короче, в медицине , социологии и маркетинге . Они часто объединяются вместе под названием «выборочные исследования».

Отличие выборочных исследований от экспертных проявляется, прежде всего, в числе обследованных объектов или субъектов - в выборочных исследованиях речь обычно идет о сотнях, а в экспертных - о десятках. Зато технологии экспертных исследований гораздо изощреннее. Еще более выражена специфика в демографических или логистических моделях, при обработке нарративной (текстовой, летописной) информации или при изучении взаимовлияния факторов.

Вопросы надежности и безопасности технических устройств и технологий, теории массового обслуживания подробно рассмотрены, в большом количестве научных работ.

Статистический анализ конкретных данных

Применение статистических методов и моделей для статистического анализа конкретных данных тесно привязано к проблемам соответствующей области. Результаты третьего из выделенных видов научной и прикладной деятельности находятся на стыке дисциплин. Их можно рассматривать как примеры практического применения статистических методов. Но не меньше оснований относить их к соответствующей области деятельности человека.

Например, результаты опроса потребителей растворимого кофе естественно отнести к маркетингу (что и делают, читая лекции по маркетинговым исследованиям). Исследование динамики роста цен с помощью индексов инфляции, рассчитанных по независимо собранной информации, представляет интерес прежде всего с точки зрения экономики и управления народным хозяйством (как на макроуровне, так и на уровне отдельных организаций).

Перспективы развития

Теория статистических методов нацелена на решение реальных задач. Поэтому в ней постоянно возникают новые постановки математических задач анализа статистических данных, развиваются и обосновываются новые методы. Обоснование часто проводится математическими средствами, то есть путем доказательства теорем. Большую роль играет методологическая составляющая - как именно ставить задачи, какие предположения принять с целью дальнейшего математического изучения. Велика роль современных информационных технологий, в частности, компьютерного эксперимента.

Актуальной является задача анализа истории статистических методов с целью выявления тенденций развития и применения их для прогнозирования.

Литература

2. Нейлор Т. Машинные имитационные эксперименты с моделями экономических систем. - М.: Мир, 1975. - 500 с.

3. Крамер Г. Математические методы статистики. - М.: Мир, 1948 (1-е изд.), 1975 (2-е изд.). - 648 с.

4. Большев Л. Н., Смирнов Н. В. Таблицы математической статистики. - М.: Наука, 1965 (1-е изд.), 1968 (2-е изд.), 1983 (3-е изд.).

5. Смирнов Н. В., Дунин-Барковский И. В. Курс теории вероятностей и математической статистики для технических приложений. Изд. 3-е, стереотипное. - М.: Наука, 1969. - 512 с.

6. Норман Дрейпер, Гарри Смит Прикладной регрессионный анализ. Множественная регрессия = Applied Regression Analysis. - 3-е изд. - М.: «Диалектика» , 2007. - С. 912. - ISBN 0-471-17082-8

Смотри также

Wikimedia Foundation . 2010 .

Смотреть что такое "Статистические методы" в других словарях:

СТАТИСТИЧЕСКИЕ МЕТОДЫ научные методы описания и изучения массовых явлений, допускающих количественное (численное) выражение. Слово “статистика” (от игал. stato государство) имеет общий корень со словом “государство”. Первоначально оно… … Философская энциклопедия

Научные методы описания и изучения массовых явлений, допускающих количественное (численное) выражение. Слово «статистика» (от итал. stato – государство) имеет общий корень со словом «государство». Первоначально оно относилось к науке управления и … Философская энциклопедия

- (в экологии и биоценологии) методы вариационной статистики, позволяющие исследовать целое (напр., фитоценоз, популяцию, продуктивность) по его частным совокупностям (напр., по данным, полученным на учетных площадках) и оценить степень точности… … Экологический словарь

статистические методы - (в психологии) (от лат. status состояние) нек рые методы прикладной математической статистики, используемые в психологии в основном для обработки экспериментальных результатов. Основная цель применения С. м. повышение обоснованности выводов в… … Большая психологическая энциклопедия

Статистические методы - 20.2. Статистические методы Конкретные статистические методы, используемые для организации, регулирования и проверки деятельности, включают, но не ограничиваются следующими: а) планированием экспериментов и факторный анализ; b) анализ дисперсии и … Словарь-справочник терминов нормативно-технической документации

СТАТИСТИЧЕСКИЕ МЕТОДЫ - методы исследования количеств. стороны массовых обществ. явлений и процессов. С. м. дают возможность в цифровом выражении характеризовать происходящие изменения в обществ. процессах, изучать разл. формы социально экономич. закономерностей, смену… … Сельско-хозяйственный энциклопедический словарь

СТАТИСТИЧЕСКИЕ МЕТОДЫ - некоторые методы прикладной математической статистики, используемые для обработки экспериментальных результатов. Ряд статистических методов был разработан специально для проверки качества психологических тестов, для применения в профессиональном… … Профессиональное образование. Словарь

Статистические методы анализа данных принято делить на две большие группы: одномерные методы статистического анализа и многомерные методы.

Одномерные методы анализа - это методы, которые применяют в случаях, если существует единый измеритель для оценки каждого элемента выборки, либо если этих измерителей несколько, каждая переменная анализируется отдельно от всех остальных . В центре внимания данных методов находится анализ средних значений и показателей вариации переменных.

Классификация одномерных методов осуществляется по характеру исходных данных (метрические или неметрические), а также по количеству и типу выборок. Так, выборки делят на зависимые (парные) - это выборки, сформированные из одной генеральной совокупности и независимые выборки - это выборки, сформированные из различных генеральных совокупностей. На практике независимыми считают выборки, сформированные из различных страт (в случае использования стратифицированной или квотной выборки), например, мужчин и женщин или групп респондентов с различным уровнем дохода.

К одномерным методам анализа данных относят:

· Методы проверки гипотез (z-критерий, t-критерий, F-критерий, χ2-критерий и т.п.).

Более подробно проверку гипотез смотри: Гмурман В. Е. Теория вероятностей и математическая статистика.

· Методы анализа статистических рядов распределения.

· Однофакторный дисперсионный анализ.

· Другие методы.

Многомерные методы анализа - это методы, которые применяют в случаях, если для оценки каждого элемента выборки используется два или больше измерителя и эти переменные анализируются одновременно . В центре внимания данной группы методов уже находятся анализ взаимосвязей, связей и сходства между переменными.

Выделяют следующие многомерные методы:

1) Методы выявления зависимости между переменными – это методы, в которых одна или несколько переменных являются зависимыми, а другие независимыми. К этой группе относят:

· корреляционно-регрессионный анализ;

· дисперсионный и ковариационный анализ;

· дискриминантный анализ;

· совместный анализ.

2) Методы выявления взаимозависимости между переменными – это методы, позволяющие группировать данные на основе сходства. В данных методах нет деления переменных на зависимые и независимые. К этой группе относят:

· кластерный анализ;

· факторный анализ;

· многомерное шкалирование.

Выбор методов анализа данных осуществляется на основе:

· цели, задач, рабочих гипотез маркетингового исследования;

· типа маркетингового исследования (поисковое или итоговое; описательное или причинно-следственное);

· типа собранных данных - метрические и неметрические переменные;

· шкал, используемых в исследовании;

· объема и метода выборки;

· метода сбора данных;

· области применения и ограничений статистических методов анализа данных.

По сути все предшествующие этапы маркетингового исследования предопределяют выбор стратегии анализа данных. Немалую роль при этом играет опыт и квалификация самого исследователя. В заключении отметим, что сложные многомерные методы статистического анализа данных используются не всегда. Очень часто исследователь ограничивается лишь предварительным (базовым) анализом данных и его графической интерпретацией.

Конечно же, необходимо помнить, что анализ данных маркетингового исследования - это не последний его этап, за ним следует разработка практических рекомендаций и формирование отчета исследования.

Под методами статистического анализа понимаются приемы прикладной математики, которые используются для повышения объективности и достоверности получаемых данных, для обработки экспериментальных результатов. В дифференциальной психологии наиболее часто применяются три таких метода – дисперсионный, корреляционный и факторный анализ .

1. Дисперсионный анализ позволяет определить меру индивидуального варьирования показателей (так как, известно, что при одинаковых средних показателях размах распределения может существенно отличаться). Для некоторых исследовательских и практических задач именно дисперсия дает основную информацию. Например, представим себе, что средний балл, полученный школьниками за контрольную работу по алгебре, составляет «4» и для мальчиков, и для девочек. Но у мальчиков присутствуют и тройки, и пятерки, а все девочки активно списывали друг у друга и в результате получили по четверке. Понятно, что итог одинаков в каждой группе, а психолого-педагогический смысл, стоящий за средним баллом, совершенно различен.

2. Корреляционный анализ удостоверяет наличие связи, зависимости между изучаемыми переменными. При этом подтверждается одновременность проявления этих признаков, но не их причинная обусловленность. Если две какие-либо характеристики, полученные для одного и того же объекта, имеют тенденцию изменяться совместно, так что имеется возможность предсказать одну из них по значению другой, то говорят, что эти характеристики коррелируют друг с другом. Например, отмечается, что удовлетворенность браком у супругов отрицательно коррелирует с тревожностью. Это значит, что чем больше они довольны семейной жизнью, тем спокойнее себя ощущают. Однако на основании этого факта мы не можем узнать, спокойны ли они по той причине, что дома все в порядке, или довольны совместной жизнью потому, что обладают низкой тревожностью и общим позитивным отношением к жизни.

Математически наличие зависимости между признаками выражается в показателе коэффициента корреляции: два одинаковых признака связаны между собой коэффициентом «1»; два различных – коэффициентом «0». Степень связанности характеристик лежит в диапазоне от 0,01 до 0,99. Близкие к нулю корреляции не могут подтверждать наличие зависимости между переменными. Соотношение может быть как позитивным (+1), так и негативным (-1). Отрицательный коэффициент корреляции означает, что при увеличении значения одного признака, значение другого признака уменьшается. Коэффициент корреляции был предложен Карлом Спирменом для измерения соотношения между двумя интеллектуальными показателями (1901). Сходное открытие сделал и один из учеников Ф. Гальтона Карл Пирсон .

3. Факторный анализ – это группа методов, предназначенных для определения свойств, которые нельзя наблюдать и измерять непосредственно. Идея факторного анализа принадлежит К. Спирмену, который предложил выявлять общие закономерности на основе анализа матрицы коэффициентов корреляции. В том случае, если по результатам подсчета коэффициентов корреляции будут прослеживаться особо плотные связи между несколькими показателями (корреляционные плеяды), можно предположить, что за ними стоит общий фактор – переменная более высокого уровня обобщения.

При использовании такого способа структурирования и обобщения психологической информации появляется возможность получить компактное описание объекта измерения, выделить наиболее существенные и независимые друг от друга характеристики. Данная возможность позволяет использовать факторный анализ для решения следующих психодиагностических задач:

- «концептуальная чистка» (уточнение психологического содержания изучаемых феноменов);

Конструирование тестов;

Проверка психометрических свойств опросников (особенно в тех случаях, когда опросники применяются в новых культурах или популяциях).

В дифференциальной психологии методы факторного анализа широко используется при изучении структуры индивидуальности, а также ее отдельных составляющих, таких, например, как темперамент, интеллект и личность. Выявленные факторы рассматриваются в качестве устойчивых и относительно независимых свойств, характеризующих изучаемую структуру.

При этом принимаются во внимания разные уровни обобщения информации, в соответствии с которыми выделяют три типа факторов:

Общие факторы, объединяющие в себе все измерения данного свойства, например общий фактор интеллекта или общий фактор активности;

Групповые факторы, включающие в себя не все, но значительное число измерений данного свойства;

Специфические или уникальные факторы, относящиеся лишь к одному типу измерений .

В качестве ограничений факторного анализа стоит отметить относительную субъективность его методов. Результаты факторизации зависят от природы и количества переменных, подвергающихся анализу. Решение о выборе формы факторного анализа и тех переменных, которые должны быть включены в исходную матрицу, принимается, исходя из этих параметров, а также из теоретических позиций каждого исследователя. В итоге создаются модели индивидуальности, отличающиеся не только по количеству выделенных факторов, но и по характеру связей, обнаруженных между ними.

Как отмечает польский исследователь Ян Стреляу, использование этого метода имеет существенные изъяны. У разных авторов количество и качество выделяемых факторов разное, хотя исходный материал, образующий основу для выделения факторов остается неизменным. Как правило, исследователи расходятся уже в исходном пункте – выборе данных, подлежащих факторному анализу. Это приводит к тому, что содержание выделенных структур индивидуальности существенно отличается друг от друга. Изъян заложен в самом методе, который является произвольным и зависит от интуиции и настойчивости исследователя .

Для того чтобы грамотно использовать методы статистического анализа, необходимо быть уверенным в нормальности распределения изучаемого качества.

Нормальное распределение появилось благодаря исследованиям интеллекта. Ф. Гальтон был первым, кто обнаружил, что различия в интеллекте могут быть измерены количественно через установление степени выраженности этих характеристик у разных людей. Он предположил, что эти различия нормально распределены в популяции, т.е. небольшие группы людей обладают высоким (14%) или низким (14%) уровнем интеллекта, а большая часть выборки (68%) занимает положение в середине (1869). На крайние проявления приходится 4% (по 2% на каждый полюс).

В графическом изображении нормальное распределение имеет форму купола: отдельные значения переменной располагаются симметрично относительно центра. При этом центральное значение совпадает с медианой– точкой, выше которой находится ровно половина переменных, и ниже – также ровно половина.

Наряду с нормальным распределением часто встречаются асимметричные распределения и бимодальные. Тем не менее, даже при условии нормального распределения существует вероятность того, что полученные результаты окажутся случайными. Эта вероятность называется «уровнем значимости». Например, несмотря на высокие значения, коэффициент корреляции может иметь разный уровень значимости – вплоть до «нулевого». Уровень значимости зависит от объема выборки и разброса значений.

Аналогичным образом различные или сходные на вид показатели не всегда являются статистическими значимыми. Существуют разные способы выявления значимости различий. Их выбор зависит от характера распределения экспериментальных данных, зависимости или независимости переменных, а также от степени необходимой точности, которая определяется задачами исследования.