Выборка данных из генеральной совокупности. Практические примеры расчета

Необходимость проводить выборочные исследования, может быть вызвана различными причинами:

    часто полное исследование изучаемого явления слишком дорого стоящее и длительное;

    иногда возможность использовать полученную информацию при полном исследовании может исчерпаться раньше, чем завершится процесс его подготовки;

    в некоторых случаях в результате проверки качества изделия происходит уничтожение исследуемого объекта.

Пример:

    предположим, совокупность — это все учащиеся школы (600 человек из 20 классов, по 30 человек в каждом классе). Предмет изучения — отношение к курению.

Генеральная совокупность — это набор объектов, о которых необходимо получить информацию.

Генеральная совокупность состоит из всех объектов, которые имеют качества, свойства, интересующие исследователя. Иногда генеральная совокупность — это все взрослое население определённого региона (например, когда изучается отношение потенциальных избирателей к кандидату), чаще всего задаётся несколько критериев, определяющих объекты исследования. Например, женщины 10-89 лет, использующие крем для рук определённой марки не реже одного раза в неделю, и имеющие доход не ниже 5 тысяч рублей на одного члена семьи.

Выборка — это небольшой набор объектов, извлеченных из генеральной совокупности.

Выборочная совокупность — это необходимый для исследования минимум результатов (случаев, испытуемых, объектов, событий, образцов) отобранных с помощью определённой процедуры из генеральной совокупности.

Примеры:

    выявление реакции клиентов фирмы на нововведения, все клиенты фирмы представляют собой генеральную совокупность. Те клиенты, которых обзвонили, образуют выборку.

    При аудиторской проверке фирм с большим числом сделок приходится довольствоваться изучением отобранного числа сделок. Все сделки фирмы образуют генеральную совокупность, отобранные — выборку.

    генеральную совокупность образуют все призывники определенного года.

    все лампы, изготовленные за определенное время на некотором предприятии, образуют генеральную совокупность. Те лампы, которые отобраны для контроля, — выбору.

Выборка может рассматриваться в качестве репрезентативной или нерепрезентативной. Выборка будет репрезентативной при обследовании большой группы людей, если внутри этой группы есть представители разных подгрупп, только так можно сделать верные выводы. .

Репрезентати́вность — соответствие характеристик выборки характеристикам популяции или генеральной совокупности в целом. Репрезентативность определяет, насколько возможно обобщать результаты исследования с привлечением определённой выборки на всю генеральную совокупность, из которой она была собрана.

Также репрезентативность можно определить, как свойство выборочной совокупности представлять параметры генеральной совокупности, значимые с точки зрения задач исследования.

Пример: выборка, состоящая из 60 учеников старших классов, гораздо хуже представляет совокупность, чем выборка из тех же 60 человек, в которую войдут по 3 ученика из каждого класса. Главной причиной тому — неравное возрастное распределение в классах. Следовательно, в первом случае репрезентативность выборки низкая, а во втором случае репрезентативность высокая (при прочих равных условиях).

Задача 1. В городе, насчитывающем 253 000 жителей, имеющих право голосовать, исследуйте политические симпатии будущих избирателей.

Решение

    Выборку можно построить, опрашивая каждого 15-о покупателя, выходящего из крупного торгового центра. Такая выборка будет отражать мнение посетителей торгового центра, но вряд ли будет представлять точку зрения всех жителей города.

    Другой метод построения выборки — провести опрос по телефону каждого 100-го жителя города, взяв номера из телефонного справочника. Такая систематическая выборка даст информацию о точке зрения группы людей, имеющих телефон, находящихся дома и отвечающих на телефонные звони. Но она не отражает мнения всех жителей города.

    Еще один метод построить выборку может заключаться в том, чтобы опросить участников митинга, организованного несколькими политическими партиями. Такая выборкка даст информацию о жителях, активно участвующих в политической жизни города.

Итак, нужны такие способы образования выборки, которые представляли бы всю генеральную совокупность, т. е. выборка должна быть репрезентативной (представительной).

Задача 2. Определить, является ли репрезентативной выборка:

1) число автомобильных аварий в июне, если необходимо составить статистический отчет по авариям в городе за год;

2) городские жители при подсчете числа автомобилей на душу населения в стране;

3) люди в возрасте от 40 до 50 лет при выяснении рейтинга молодежной телепрограммы.

Решение

1) Выборка не является репрезентативной. Летом нет снега и наледи на дорогах, а это одна из основных причин аварий.

2) Выборка не является репрезентативной. Понятно, что в городе машин намного больше, чем в сельских районах. Это необходимо учитывать.

3) Выборка не является репрезентативной. Люди в возрасте от 40 до 50 лет едва ли проявят интерес к программе, ориентированной на молодежную аудиторию. При использовании такой выборки рейтинг может сильно упасть, но это не отразит реального положения вещей. Для формирования выборочной совокупности применяются различные способы отбора. Статистические данные должны быть представлены так, чтобы ими можно было пользоваться.

Параметры генеральной совокупности и выборки

N - генеральная совокупность, которая подразделяется на страты N 1 , N 2 и так далее.

Страты представляют собой однородные объекты с точки зрения статистических характеристик (например, население делится на страты по возрастным группам или социальной принадлежности; предприятия — по отраслям). В этом случае выборки называются стратифицированными.

N - объем выборки.

В основе статистических выводов проведенного исследования лежит распределение случайной величины Х, наблюдаемые же значения х 1 , х 2 , х 3 называются реализациями случайной величины x.

Распределение случайной величины X в генеральной совокупности носит теоретический, идеальный характер, а ее выборочный аналог является эмпирическим распределением

Для выборки же функцию распределения определить трудно, а иногда невозможно, поэтому параметры оценивают по эмпирическим данным, а затем их подставляют в аналитическое выражение, описывающее теоретическое распределение. При этом предположение о виде распределения может быть как статистически верным, так и ошибочным.

Но в любом случае восстановленное по выборке эмпирическое распределение лишь грубо характеризует истинное.

Важнейшими параметрами распределений являются математическое ожидание а и дисперсия σ 2 - мера разброса данных.

Стандартное отклонение σ - степень отклонения данных наблюдений или множеств от среднего значения.

Задача 3. Михаил вместе со своими друзьями решил измерить рост своих собак (по холке). Найдите: среднее значение; отклонение роста.

Решение

    Математическое ожидание или среднее значение можно найти по формуле:


    Теперь посчитаем отклонение роста каждой собаки от среднего или математического ожидания, то есть посчитаем дисперсию.


Стандартное отклонение это всего лишь квадратный корень из дисперсии.

σ \ = 147,32

Таким образом, зная стандартное отклонение мы знаем, что значит «нормальный рост», и что является очень высокой и очень маленькой собакой.

Ответ: 394, 21,704; 147,32.

Задача 4. Наблюдение в контрольной лаборатории за сроком годности 50 электроламп одинаковой мощности, взятых наудачу из большой партии выпущенных заводом ламп этой же мощности, привело к следующим данным о нарушении установленного гарантийного срока горения:

Отклонение в Ч

10 мального распределения, которое отражает отклонение фактического срока горения лампочек от гарантийного.

Решение.

Среднее отклонение

Таким образом, искомое нормальное распределение характеризуется следующими значениями параметров: а = 0,4; σ 2 = 318; σ = 17,8.

Отсюда плотность вероятности:

Соответствующая этой плотности функция распределения будет выглядеть:

Это наука, которая, основываясь на методах теории вероятностей, занимается систематизацией и обработкой статистических данных для получения научных и практических выводов.

Статистическими данными называются сведения о числе объектов, обладающих теми или иными признаками.

Группа объектов, объединенных по некоторому качественному или количественному признаку, называется статистической совокупностью . Объекты, входящие в совокупность, называются её элементами, а их общее число - ее объемом.

Генеральной совокупностью называется множество всех мыслимо возможных наблюдений, которые могли бы быть сделаны при данном реальном комплексе условий или более строго: генеральной совокупностью называется случайная величина x и связанное с ней вероятностное пространство {W,Á,Р}.

Распределение случайной величины x называют распределением генеральной совокупности (говорят, например, о нормально распределенной или просто нормальной генеральной совокупности).

Например, если производится ряд независимых измерений случайной величины x, то генеральная совокупность теоретически бесконечна (т.е. генеральная совокупность - абстрактное, условно - математическое понятие); если же проверяется число дефектных изделий в партии из N изделий, то эту партию рассматривают как конечную генеральную совокупность объема N.

В случае социально-экономических исследований генеральной совокупностью объема N может быть население какого-то города, региона или страны, а измеряемыми признаками - доходы, расходы или объем сбережений отдельно взятого человека. Если какой-то признак имеет качественный характер (например, пол, национальность, социальное положение, род деятельности и т.п.), но принадлежит к конечному множеству вариантов, то он может быть также закодирован числом (как это часто делают в анкетах).

Если число объектов N достаточно велико, то провести сплошное обследование затруднительно, а иногда физически невозможно (например, проверить качество всех патронов). Тогда случайным образом отбирают из всей генеральной совокупности ограниченное число объектов и подвергают их изучению.

Выборочной совокупностью или просто выборкой объема n называется последовательность х 1 , х 2 , …, х n независимых одинаково распределенных случайных величин, распределение каждой из которых совпадает с распределением случайной величины x.

Например, результаты n первых измерений случайной величины x принято рассматривать как выборку объема n из бесконечной генеральной совокупности. Полученные данные называют наблюдениями случайной величины x, а также говорят, что случайная величина x "принимает значения" х 1 , х 2 , …, х n .


Основная задача математической статистики - сделать научно обоснованные выводы о распределении одной или более неизвестных случайных величин или их взаимосвязи между собой. Метод, состоящий в том, что на основании свойств и характеристик выборки делаются заключения о числовых характеристиках и законе распределения случайной величины (генеральной совокупности) называется выборочным методом.

Для того, чтобы характеристики случайной величины, полученные выборочным методом, были объективны, необходимо, чтобы выборка была репрезентативной, т.е. достаточно хорошо представляла исследуемую величину. В силу закона больших чисел можно утверждать, что выборка будет репрезентативной, если ее осуществить случайно, т.е. все объекты генеральной совокупности имеют одинаковую вероятность попасть в выборку. Для этого существуют различные виды отбора выборки.

1. Простым случайным отбором называется отбор, при котором объекты извлекаются по одному из всей генеральной совокупности.

2. Стратифицированный (расслоенный ) отбор заключается в том, что исходная генеральная совокупность объема N подразделяется на подмножества (страты) N 1 , N 2 ,…,N k , так что N 1 + N 2 +…+ N k = N. Когда страты определены, из каждого из них извлекается простая случайная выборка объема n 1 , n 2 , …, n k . Частным случаем стратифицированного отбора является типический отбор, при котором объекты отбирают не из всей генеральной совокупности, а из каждой типической ее части.

Комбинированный отбор сочетает в себе сразу несколько видов отбора, образующих различные фазы выборочного обследования. Существуют и другие методы организации выборки.

Выборка называется повторной , если отобранный объект перед выбором следующего возвращается в генеральную совокупность. Выборка называется бесповторной , если отобранный объект в генеральную совокупность не возвращается. Для конечной генеральной совокупности случайный отбор без возвращения приводит на каждом шаге к зависимости отдельных наблюдений, случайный равновозможный выбор с возвращением - к независимости наблюдений. На практике обычно имеют дело с бесповторными выборками. Тем не менее, когда объем генеральной совокупности N во много раз больше, чем объем выборки n (например, в сотни или тысячи раз), зависимостью наблюдений можно пренебречь.

Таким образом, случайная выборка х 1 , х 2 , …, х n - это результат последовательных и независимых наблюдений над случайной величиной ξ, представляющую генеральную совокупность, и все элементы выборки имеют тоже распределении, что исходная случайная величина x.

Функцию распределения F x (х) и другие числовые характеристики случайной величины x будем называть теоретическими, в отличие от выборочных характеристик , которые определяются по результатам наблюдений.

Пусть выборка х 1 , х 2 , …, х к есть результат независимых наблюдений случайной величины x, причем х 1 наблюдалось n 1 раз, х 2 - n 2 раза, …, х к - n к раз, так что n i = n - объем выборки. Число n i , показывающее, сколько раз появилось значение х i в n наблюдениях, называется частотой данного значения, а отношение n i /n = w i - относительной частотой . Очевидно, что числа w i рациональны и .

Статистическая совокупность, расположенная в порядке возрастания признака, называется вариационным рядом . Его члены обозначают x (1) , x (2), … x (n) и называют вариантами . Вариационный ряд называется дискретным , если его члены принимают конкретные изолированные значения. Статистическим распределением выборки дискретной случайной величины x называется перечень вариант и соответствующих им относительных частот w i . Полученная таблица называется статистическим рядом.

X (1) x (2) ... x k(k)
ω 1 ω 2 ... ω k

Наибольшее и наименьшее значения вариационного ряда обозначают x min и x max и называют крайними членами вариационного ряда.

Если изучается непрерывная случайная величина, то группировка заключается в разбиении интервала наблюдаемых значений на k частичных интервалов равной длины h, и подсчете числа попаданий наблюдений в эти интервалы. Полученные числа принимают за частоты n i (для некоторой новой, уже дискретной случайной величины). В качестве новых значений вариант x i обычно берутся середины интервалов (либо в таблице указываются сами интервалы). Согласно формуле Стерждеса рекомендуемое число интервалов разбиения k » 1 + log 2 n , а длины частичных интервалов равны h = (x max - x min)/k. Предполагается, что весь интервал имеет вид .

Графически статистические ряды могут быть представлены в виде полигона, гистограммы или графика накопленных частот.

Полигоном частот называют ломаную линию, отрезки которой соединяют точки (x 1 , n 1), (x 2 , n 2), …, (x k , n k). Полигоном относительных частот называют ломаную, отрезки которой соединяют точки (x 1 , w 1), (x 2 , w 2), …, (x k , w k). Полигоны обычно служат для изображения выборки в случае дискретных случайных величин (рис. 7.1.1).

Рис. 7.1

.1.

Гистограммой относительных частот называется ступенчатая фигура, состоящая из прямоугольников, основанием которых служат частичные интервалы длиною h , а высоты

равны w i /h.

Гистограмма обычно служит для изображения выборки в случае непрерывных случайных величин. Площадь гистограммы равна единице (рис. 7.1.2). Если на гистограмме относительных частот соединить середины верхних сторон прямоугольников, то полученная ломанная образует полигон относительных частот. Поэтому гистограмму можно рассматривать как график эмпирической (выборочной) плотности распределения f n (x). Если у теоретического распределения существует конечная плотность, то эмпирическая плотность является некоторым приближением теоретической.

Графиком накопленных частот называется фигура, строящаяся аналогично гистограмме с той разницей, что для расчета высот прямоугольников берутся не простые, а накопленные относительные частоты , т.е. величины . Эти величины не убывают, и график накопленных частот имеет вид ступенчатой "лестницы" (от 0 до 1).

График накопленных частот на практике используются для приближения теоретической функции распределения.

Задача. Анализируется выборка из 100 малых предприятий региона. Цель обследования - измерение коэффициента соотношения заемных и собственных средств (х i) на каждом i-ом предприятии. Результаты представлены в таблице 7.1.1.

Таблица Коэффициенты соотношений заемных и собственных средств предприятий.

5,56 5,45 5,48 5,45 5,39 5,37 5,46 5,59 5,61 5,31
5,46 5,61 5,11 5,41 5.31 5,57 5,33 5,11 5,54 5,43
5,34 5,53 5,46 5,41 5,48 5,39 5,11 5,42 5,48 5,49
5,36 5,40 5,45 5,49 5,68 5,51 5,50 5,68 5,21 5,38
5,58 5,47 5,46 5,19 5,60 5,63 5,48 5,27 5,22 5,37
5,33 5,49 5,50 5,54 5,40 5.58 5,42 5,29 5,05 5,79
5,79 5,65 5,70 5,71 5,85 5,44 5,47 5,48 5,47 5,55
5,67 5,71 5,73 5,05 5,35 5,72 5,49 5,61 5,57 5,69
5,54 5,39 5,32 5,21 5,73 5,59 5,38 5,25 5,26 5,81
5,27 5,64 5,20 5,23 5,33 5,37 5,24 5,55 5,60 5,51

Построить гистограмму и график накопленных частот.

Решение . Построим группированный ряд наблюдений:

1. Определим в выборке х min = 5,05 и x max = 5,85;

2. Разобьем весь диапазон на k равных интервалов: k » 1 + log 2 100 = 7,62; k = 8, отсюда длина интервала

Таблица 7.1.2. Сгруппированный ряд наблюдений

Номер Интервала Интервалы Середины интервалов х i w i f n (x)
5,05-5,15 5,1 0,05 0,05 0,5
5,15-5,25 5,2 0,08 0,13 0,8
5,25-5,35 5,3 0,12 0,25 1,2
5,35-5,45 5,4 0,20 0,45 2,0
5,45-5,55 5,5 0,26 0,71 2,6
5,55-5,65 5,6 0,15 0,86 1,5
5,65-5,75 5,7 0,10 0,96 1,0
5,75-5,85 5,8 0,04 1,00 0,4

На рис. 7.1.3 и 7.1.4, построенных по данным таблицы 7.1.2, представлены гистограмма и график накопленных частот. Кривые соответствуют плотности и функции нормального распределения, "подобранного" к данным.

Таким образом, распределение выборки является некоторым приближением распределения генеральной совокупности.

100 р бонус за первый заказ

Выберите тип работы Дипломная работа Курсовая работа Реферат Магистерская диссертация Отчёт по практике Статья Доклад Рецензия Контрольная работа Монография Решение задач Бизнес-план Ответы на вопросы Творческая работа Эссе Чертёж Сочинения Перевод Презентации Набор текста Другое Повышение уникальности текста Кандидатская диссертация Лабораторная работа Помощь on-line

Узнать цену

Генеральная совокупность - вся изучаемая выборочным методом статистическая совокупность объектов и/или явлений общественной жизни, имеющих общие качественные признаки или количественные переменные.

Суммарная численность объектов наблюдения (люди, домохозяйства, предприятия, населенные пункты и т.д.), обладающих определенным набором признаков (пол, возраст, доход, численность, оборот и т.д.), ограниченная в пространстве и времени. Примеры генеральных совокупностей:
- Все жители Москвы (10,6 млн. человек по данным переписи 2002 года)
- Мужчины-Москвичи (4,9 млн. человек по данным переписи 2002 года)
- Юридические лица России (2,2 млн. на начало 2005 года)
- Розничные торговые точки, осуществляющие продажу продуктов питания (20 тысяч на начало 2008 года) и т.д.

Корректное определение Г.С. и ее характеристик чрезвычайно важно для выбора дизайна исследования - стратегии построения репрезентативной выборки (см. ). Важнейшими характеристиками Г.С. являются ее объем и доступность элементов для определения.

С точки зрения объема, принято выделять конечные и бесконечные Г.С. Это деление является чисто техническим, оно обусловлено особенностями процедур оценивания объема и ошибок репрезентативной вероятностной (случайной) выборки. Конечными считаются Г.С., численность которых сопоставима с объемом выборки. Если объем выборки превышает несколько процентов от численности Г.С., ошибку выборки необходимо оценивать с поправкой на объем Г.С.

Бесконечными называются Г.С., объем которых, по сравнению с объемом репрезентативной случайной выборки, несоизмеримо велик. Строго говоря, все Г.С. в социальных науках конечны (даже если их численность составляет несколько миллиардов), однако на практике Г.С. можно считать бесконечной, если объем выборки, обеспечивающий приемлемый уровень ошибки, не превышает 1-2 % от ее численности. Иногда понятие бесконечности связывают непосредственно с объемом Г.С., например, более ста тысяч объектов.

Г.С., принадлежность к которым очевидна или легко устанавливается, называются конкретными. Для конкретных Г.С. несложно определить объем и получить относительно полный список их элементов - основу выборки (см. Выборки основа ). Например, список совершеннолетних жителей города можно получить в адресном столе, а списки студентов крупного города - в университетах. Если конкретная Г.С. очень велика (например, население страны), списки могут быть получены для всех ее структурных частей. Построение репрезентативной выборки случайной (см. ) для конкретных Г.С. технически всегда возможно; проблемы могут возникнуть в связи с недостатком времени, квалифицированного персонала или материальных ресурсов.

Г.С., принадлежность к которой можно установить только в результате целенаправленных процедур или специальных исследований, называются гипотетическими. К таким Г.С. относятся, например, аудитории СМК (нельзя узнать, видел ли человек конкретный рекламный ролик, если не спросить его об этом), любители определенных видов аквариумных рыбок, эксперты по узкой проблеме и т.п. Для определения объема некоторых гипотетических Г.С. также необходимы специальные исследования. Возможность построения репрезентативной выборки случайной (см. ) для гипотетичных Г.С. большого объема во многих случаях представляется проблематичной.

ГЕНЕРАЛЬНОЙ СОВОКУПНОСТИ ПАРАМЕТР - статистический термин, применяемый для обозначений любой количественной характеристики генеральной совокупности (см. ). Математическое ожидание (см. ), дисперсия (см. ), вероятность (см. ) положительного ответа, коэффициент корреляции между двумя случайными величинами (см. ) являются Г.С.П. Аналогичные характеристики выборки (см. ) называются статистиками выборочными (см. ).

Выборка (Выборочная совокупность) - множество случаев (испытуемых, объектов, событий, образцов), с помощью определённой процедуры выбранных из генеральной совокупности для участия в исследовании.
Часть объектов из генеральной совокупности, отобранных для изучения, с тем чтобы сделать заключение обо всей генеральной совокупности. Для того чтобы заключение, полученное путем изучения выборки, можно было распространить на всю генеральную совокупность, выборка должна обладать свойством репрезентативности.

Характеристики выборки:

Качественная характеристика выборки - кого именно мы выбираем и какие способы построения выборки мы для этого используем.

Количественная характеристика выборки - сколько случаев выбираем, другими словами объём выборки.

Объём выборки — число случаев, включённых в выборочную совокупность. Из статистических соображений рекомендуется, чтобы число случаев составляло не менее 30—35.

Итак, закономерности, которым подчиняется исследуемая случайная величина, физически полностью обусловливаются реальным комплексом условий ее наблюдения (или эксперимента), а математически задаются соответствующим вероятностным пространством или, что то же, соответствующим законом распределения вероятностей. Однако при проведении статистических исследований несколько более удобной оказывается другая терминология, связанная с понятием генеральной совокупности.

Генеральной совокупностью называют совокупность всех мыслимых наблюдений (или всех мысленно возможных объектов интересующего нас типа, с которых «снимаются» наблюдения), которые могли бы быть произведены при данном реальном комплексе условий. Поскольку в определении речь идет о всех мысленно возможных наблюдениях (или объектах), то понятие генеральной совокупности есть понятие условно-математическое, абстрактное и его не следует смешивать с реальными совокупностями, подлежащими статистическому исследованию. Так, обследовав даже все предприятия подотрасли с точки зрения регистрации значений характеризующих их технико-экономических показателей, мы можем рассматривать обследованную совокупность лишь как представителя гипотетически возможной более широкой совокупности предприятий, которые могли бы функционировать в рамках того же самого реального комплекса условий

В практической работе удобнее выбор связывать с объектами наблюдения, чем с характеристиками этих объектов. Мы отбираем для изучения машины, геологические пробы, людей, но не значения характеристик машин, проб, людей. С другой стороны, в математической теории объекты и совокупность их характеристик не различаются и двойственность введенного определения исчезает.

Как видим, математическое понятие «генеральная совокупность» физически полностью обусловливается, так же как и понятия «вероятностное пространство», «случайная величина» и «закон распределения вероятностей», соответствующим реальным комплексом условий, а потому все эти четыре математических понятия можно считать в определенном смысле синонимами. Генеральная совокупность называется конечной или бесконечной в зависимости от того, конечна или бесконечна совокупность всех мыслимых наблюдений.

Из определения следует, что непрерывные генеральные совокупности (состоящие из наблюдений признаков непрерывной природы) всегда бесконечны. Дискретные же генеральные совокупности могут быть как бесконечными, так и конечными. Скажем, если анализируется партия из N изделий на сортность (см. пример в п. 4.1.3), когда каждое изделие может быть отнесено к одному из четырех сортов, исследуемой случайной величиной является номер сорта случайно извлеченного из партии изделия, а множество возможных значений случайной величины состоит соответственно из четырех точек (1, 2, 3 и 4) то, очевидно, генеральная совокупность будет конечной (всего N мыслимых наблюдений).

Понятие бесконечной генеральной совокупности есть математическая абстракция, как и представление о том, что измерение случайной величины можно повторить бесконечное число раз. Приближенно бесконечную генеральную совокупность можно истолковывать как предельный случай конечной, когда число объектов, порождаемых данным реальным комплексом условий, неограниченно возрастает. Так, если в только что приведенном примере вместо партий изделий рассматривать непрерывное массовое производство тех же изделий, то мы и придем к понятию бесконечной генеральной совокупности. Практически же такое видоизменение равносильно требованию

Выборка из данной генеральной совокупности - это результаты ограниченного ряда наблюдений случайной величины . Выборку можно рассматривать как некий эмпирический аналог генеральной совокупности, то, с чем мы чаще всего на практике имеем дело, поскольку обследование всей генеральной совокупности бывает либо слишком трудоемко (в случае больших N), либо принципиально невозможно (в случае бесконечных генеральных совокупностей).

Число наблюдений, образующих выборку, называют объемом выборки.

Если объем выборки велик и при этом мы имеем дело с одномерной непрерывной величиной (или с одномерной дискретной, число возможных значений которой достаточно велико, скажем больше 10), то часто удобнее, с точки зрения упрощения дальнейшей статистической обработки результатов наблюдений, перейти к так называемым «группированным» выборочным данным. Этот переход осуществляется обычно следующим образом:

а) отмечаются наименьшее и наибольшее значения в выборке;

б) весь обследованный диапазон разбивается на определенное число 5 равных интервалов группирования; при этом количество интервалов s не должно быть меньше 8-10 и больше 20-25: выбор количества интервалов существенно зависит от объема выборки для примерной ориентации в выборе 5 можно пользоваться приближенной формулой

которую следует воспринимать скорее как оценку снизу для s (особенно при больших

в) отмечаются крайние точки каждого из интервалов в порядке возрастания, а также их середины

г) подсчитываются числа выборочных данных, попавших в каждый из интервалов: (очевидно, ); выборочные данные, попавшие на границы интервалов, либо равномерно распределяются по двум соседним интервалам, либо условливаются относить их только к какому-либо одному из них, например к левому.

В зависимости от конкретного содержания задачи в данную схему группирования могут быть внесены некоторые видоизменения (например, в некоторых случаях целесообразно отказаться от требования равной длины интервалов группирования).

Во всех дальнейших рассуждениях, использующих выборочные данные, будем исходить из только что описанной системы обозначений.

Напомним, что сущность статистических методов состоит в том, чтобы по некоторой части генеральной совокупности (т.е. по выборке) выносить суждения о ее свойствах в целом.

Один из важнейших вопросов, от успешного решения которого зависит достоверность получаемых в результате статистической обработки данных выводов, является вопрос репрезентативности выборки, т.е. вопрос полноты и адекватности представления ею интересующих нас свойств анализируемой генеральной совокупности. В практической работе одна и та же группа объектов, взятых для изучения, может рассматриваться как выборка из разных генеральных совокупностей. Так, группу семей, наудачу отобранных из кооперативных домов одной из жилищноэксплуатационных контор (ЖЭК) одного из районов города для подробного социологического обследования, можно рассматривать и как выборку из генеральной совокупности семей (с кооперативной формой жилья) данной ЖЭК, и как выборку из генеральной совокупности семей данного района, и как выборку из генеральной совокупности всех семей города, и, наконец, как выборку из генеральной совокупности всех семей города, проживающих в кооперативных домах. Содержательная интерпретация результатов апробации существенно зависит от того, представителем какой генеральной совокупности мы рассматриваем отобранную группу семей, для какой генеральной совокупности эту выборку можно считать представительной (репрезентативной). Ответ на этот вопрос зависит от многих факторов. В приведенном выше примере, в частности, от наличия или отсутствия специального (быть может, скрытого) фактора, определяющего принадлежность семьи к данной ЖЭК или району в целом (таким фактором может быть, например, среднедушевой доход семьи, географическое расположение района в городе, «возраст» района и т. п.).

http://www.hi-edu.ru/e-books/xbook096/01/index.html?part-011.htm – очень полезный сайт!

Выборочный метод исследования является основным статистическим методом. Это естественно, так как объем изучаемых объектов как правило бесконечен (и даже, если конечен, то весьма затруднительно перебрать все объекты, приходится довольствоваться лишь их частью, выборкой).

Генеральная и выборочная совокупности

Генеральной совокупностью называется совокупность всех исследуемых в данном эксперименте элементов.

Выборочной совокупностью (или выборкой) называется конечная совокупность объектов, случайно отобранных из генеральной совокупности.

Объемом совокупности (выборочной или генеральной) называется число объектов этой совокупности.

Пример генеральной и выборочной совокупностей

Допустим, исследуется психологическая предрасположенность человека к делению данного отрезка в отношении золотого сечения. Так как происхождение самого понятия золотого сечения продиктовано антропометрией человеческого тела, то понятно, что в данном случае генеральной совокупностью является любое антропогенное существо достигшее физической зрелости и приобретшее окончательные пропорции, то есть - вся взрослая часть человечества. Объем этой совокупности практически бесконечен.

Если же эта предрасположенность исследуется исключительно в художественной среде, то генеральная совокупность - это люди, имеющие непосредственное отношение к дизайну: художники, архитекторы, дизайнеры. Таких людей тоже очень много, и можно считать, что объем генеральной совокупности в данном случае тоже бесконечен.

И в том, и в другом случае для исследования мы вынуждены ограничиться разумными объемами выборок, выбирая в качестве представителей той и другой совокупностей студентов технических специальностей (как людей, далеких от художественного мира) или студентов специальности дизайн (как людей, имеющих непосредственное отношение к миру художественных образов).

Репрезентативность

Основной проблемой выборочного метода является вопрос о том, насколько точно объекты, отобранные из генеральной совокупности для исследования, представляют изучаемые характеристики генеральной совокупности, то есть - вопрос о репрезентативности выборки.

Итак, выборка называется репрезентативной (представительной), если она достаточно точно представляет количественные соотношения генеральной совокупности.

Разумеется, трудно сказать, что именно скрывается за расплывчатой формулировкой достаточно точно . Вопросы репрезентативности вообще являются наиболее спорными в любом экспериментальном исследовании. Имеется масса ставших уже классическими примеров, когда недостаточная представительность выборки приводила экспериментаторов к абсурдным результатам.

Как правило, вопросы репрезентативности решаются при помощи экспертной оценки, когда научное сообщество принимает точку зрения группы авторитетных специалистов по поводу корректности проведенного исследования.

Пример репрезентативности

Вернемся к примеру с делением отрезка. Вопросы репрезентативности выборок лежат здесь в самой основе исследования: мы ни в коем случае не должны смешивать группы испытуемых по признаку принадлежности их к художественной среде.

Статистическое распределение наблюдаемого признака

Частота наблюдаемого значения

Пусть в результате испытания в выборке объема наблюдаемый признакпринял значения,, …, причем значениенаблюдалосьраз, значение-раз, и т. д., значениенаблюдалосьраз. Тогда частотой наблюдаемого значенияназывается число, значения- числои т. д.

Относительная частота наблюдаемого значения

Относительной частотой наблюдаемого значенияпризнаканазывается отношение частотык объемувыборки:

Понятно, что сумма частот наблюдаемого признака должна давать объем выборки

а сумма относительных частот должна давать единицу:

Эти соображения можно использовать для контроля при составлении статистических таблиц. Если равенства не соблюдаются, то при протоколировании результатов эксперимента была допущена ошибка.

Статистическое распределение наблюдаемого значения

Статистическим распределением наблюдаемого признака называется соответствие между наблюдаемыми значениями признака и отвечающими им частотами (или относительными частотами).

Как правило, статистическое распределение записывается в виде двухстрочной таблицы, в которой в первой строке указываются наблюдаемые значения признака, а во второй - соответствующие им частоты (или относительные частоты):