> For the complete documentation index, see [llms.txt](https://sultanlive.gitbook.io/shad-ml/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://sultanlive.gitbook.io/shad-ml/osnovy-statistiki-chast-1/doveritelnye-intervaly-dlya-srednego.md).

# Доверительные интервалы для среднего

* Построение доверительных интервалов

Целью статистики является возможность сделать выводы относительно ГС основываясь только на выборочных данных. Очень часто исследователя интересует чему равняется среднее значение исследуемого признака во всей ГС.

{% hint style="info" %}
Пример:

Предположим в некотором исследовании приняло участие 64 человека - мужчины и женщины в возрасте от 18 до 30 лет и у каждого добровольца измерялся уровень экспрессии некоторого гена. И таким образом у нас есть данные 64 наблюдений со средним равным 100, и стандартным отклонением равным 4.

Однако исследователя интересует куда более глобальный вопрос - а чему равен средний уровень экспрессии этого гена в всей ГС?
{% endhint %}

![Пример](https://4138034190-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-LhHAPwIUaHw_JDcpqVI%2F-Ln2LfNbG7Lob1PfyxLy%2F-Ln2O0MOBkT6oLtOyUea%2Fimage.png?alt=media\&token=6e381a18-50fb-4170-bfd2-4a56065aaf70)

Исходя из примера, ГС это будет все женщины и мужчины во возрасте \[18; 30]. И пригласить всех этих людей непростая задача. К сожалению мы не можем абсолютно точно сказать чему именно равняется средний в ГС. Но мы сможем посчитать такой интервал, относительно которого можем быть уверены в том что он включает интересующий нас параметр.

Для этого нужно знать свойство [нормального распределения](/shad-ml/osnovy-statistiki-chast-1/normalnoe-raspredelenie.md) и [центрально предельную теорему](/shad-ml/osnovy-statistiki-chast-1/centralnaya-predelnaya-teorema.md).&#x20;

![](https://4138034190-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-LhHAPwIUaHw_JDcpqVI%2F-Ln2LfNbG7Lob1PfyxLy%2F-Ln2QEYs5zC_XgR3tHC6%2Fimage.png?alt=media\&token=06b8915b-c7a6-4724-a2dc-dbe7a8937ad6)

И так мы знаем, что если бы многократно повторяли наш эксперимент, то все выборочные средние распределились бы нормальным образом вокруг среднего ГС (нас интересует этот параметр) и со стандартной ошибкой среднего $$se = \frac{sd\_{x}}{\sqrt{n}}$$ . И также знаем что 95% всех выборочных средних по свойству нормального распределения лежали бы в диапазоне нашей средней ГС $$\mu \pm 1.96\sigma$$  или в нашем случае $$\mu \pm 1.96se$$.

Мы как раз таки не знаем чему равняется среднее ГС. Но мы можем взглянуть на эту картинку немного по другому.

![](https://4138034190-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-LhHAPwIUaHw_JDcpqVI%2F-Ln2LfNbG7Lob1PfyxLy%2F-Ln2Se9kmyVUKgMWf2NW%2Fimage.png?alt=media\&token=2ab7d1fd-6172-479f-9f60-9ba045c02b9c)

Предположим что мы рассчитывали бы такой показатель для каждого из выборочных средних. Пусть зеленый столбик выборочное среднее равняется $$x\_1$$ , если бы мы рассчитали интервал для такого выборочного среднего $$x\_1 \pm 1.96se$$, то как видим, этот интервал включил бы в себя среднее ГС. Если бы мы рассчитали такой интервал для среднего $$x\_2$$ , то такой интервал также включил в себя среднее ГС. Таким образом 95% процентов всех выборочных средних включили бы в себя среднее ГС, если бы рассчитывали такой интервал и только те выборочные средние, которые очень далеко отклонились от среднего ГС например $$x\_4$$ и не включили бы в свой 95% интервал среднее ГС.&#x20;

Таким образом если бы многократно извлекали бы выборки одинакового размера из ГС, в каждой выборке рассчитывали бы среднее и для него свой  95% доверительный интервал, то в 95% всех случаях такой интервал включал бы в себя среднее ГС.

Рассчитаем доверительный интервал для наших выборных данных.

![Рассчитываем доверительный интервал](https://4138034190-files.gitbook.io/~/files/v0/b/gitbook-legacy-files/o/assets%2F-LhHAPwIUaHw_JDcpqVI%2F-Ln2WTSrlssWu0QmzyOI%2F-Ln2XY6WI4JNIi4Cl2aZ%2Fimage.png?alt=media\&token=1821bdaf-d517-4867-a90b-cc94345e9a2d)

{% hint style="info" %}
Если мы рассчитали 95% доверительный интервал для среднего значения, то какие из следующих утверждений являются верными?

* [ ] Среднее значение в генеральной совокупности точно превышает нижнюю границу 95% доверительного интервала.
* [ ] Если многократно повторять эксперимент, то 95 % выборочных средних значений будут принадлежать рассчитанному нами доверительному интервалу.
* [x] Если многократно повторять эксперимент, для каждой выборки рассчитывать свой доверительный интервал, то в 95 % случаев истинное среднее будет находиться внутри доверительного интервала.
* [x] Мы можем быть на 95% уверены, что среднее значение в генеральной совокупности принадлежит рассчитанному доверительному интервалу.
* [ ] Среднее значение в генеральной совокупности точно принадлежит рассчитанному доверительному интервалу.
  {% endhint %}
