История Рунета в квадратах | Черный квадрат | Аналитика | О проекте |
Индексы цитирования сайтов Рунета
Цели, задачи и методыНа сегодняшний день авторитетность веб-сайта является очень важной его характеристикой: от авторитетности зависят позиции в выдаче поисковых систем, рекламные поступления сайтов и многое другое. Предложенная Google модель авторитетности сайта основывается на индексе цитирования: чем больше ссылаются на сайт, тем он авторитетнее и тем больший вес имеет ссылка с него на другой сайт. Информацию об индексе цитирования можно получить непосредственно от поисковых систем:
Задачами настоящего исследования были:
ДанныеАнализировались индексы цитирования для WWW-сайтов в доменах второго уровня в TLD .RU и .SU. Список доменов был зафиксирован на момент начала исследования (24 сентября 2006 года) - 477494 сайта, отвечающих следующим условиям:
Google PageRank в РунетеОпределение Google PageRank производилось путем запроса к toolbarqueries.google.com. В случае, когда у www.site.ru и site.ru были разные PR, бралось большее значение. Далее в тексте Toolbar PageRank, PageRank и PR употребляются как синонимы.Распределение величины Google PR для отобранных доменов выглядит следующим образом:
Считается, что величина PageRank, отдаваемая Google в виде целого числа в диапазоне 0-10 — это логарифм истинного значения PageRank, используемого при ранжировании. Анализ распределения PR по сайтамПостроим график в координатах PR/количество сайтов. По горизонтальной оси - Toolbar PageRank (уже логарифмическая величина), по вертикальной - логарифм количества сайтов с таким PR:![]() Обычное для WWW-страниц распределение цитируемости выглядит в логарифмических координатах как прямая линия (см статью о видах сетей, где примеры зависимостей подробно разбираются), однако для головных страниц сайтов Рунета получается зависимость, характерная для цитирования в научных работах: значительно меньшая доля документов с экстремально низкими индексами цитирования. В обоих случаях изменение вида распределения может быть объяснено самоцитированием (ученые ссылаются на собственные работы, вторые страницы сайтов - на головную страницу).
Шум в области PR 0—2 объясняется, по всей видимости,
округлениями величины PR после логарифмирования (см. ниже
раздел об индексе цитирования Яндекса).
Несмотря на шум, полином второго порядка (в логарифмических
координатах) описывает получаемые данные с коэффициентом
корреляции 0.98.
Яндекс.тИЦТематический индекс цитирования Яндекса (далее в тексте ТИЦ) был получен путем ручного просмотра всех 477494 сайтов браузером с установленным Yandex.Bar (лицензия Яндекса запрещает автоматическое обращение к их сервису). Работу выполняла тысяча китайцев, которые разделили черный квадрат на подквадратики и честно их прокликали.272969 сайтов (из рассматриваемых 477494) имеют ТИЦ менее 10, остальные значения ТИЦ лежат в диапазоне от 10 до 110000. Для удобства сравнения с Google PR, данные были разложены на 9 логарифмических классов по формуле: Lcy = ROUND(ln(cy)/1.375),1) .
Распределение величин ТИЦ для рассматриваемых сайтов выглядит следующим образом:
Корреляция ТИЦ и PRВыведем на график в логарифмических координатах одновременно распределение сайтов по PR и по логарифму ТИЦ.![]() Как видно из графика, для первых пяти (из девяти) логарифмических классов, имеется практически точное совпадение функций распределения (сайтов по классам). Это позволяет утверждать, что Toolbar PageRank получен путем логарифмирования целых значений индекса цитирования, а шум в области малых значений вызван, в первую очередь, ошибками округления. В области высоких значений индекса цитирования два графика распределения значимо расходятся (на диаграмме приведены графики полиномов второго порядка, описывающих, соответственно, распределение сайтов по PR и по ТИЦ, каждый из них имеет коэффициент корреляции с исходными данными на уровне 0.98). Как мы видим, количество сайтов с высоким ТИЦ падает быстрее, чем количество сайтов с высокими значениями PR. Это может объясняться рядом причин:
Медианные значения ТИЦДля сайтов с положительными PR и ТИЦ (всего таких сайтов 162941) была построена таблица медианных значений ТИЦ для заданного PR:
Сравнивая данные индексов цитирования конкретного сайта с данной таблицей можно определить
"международность" или "рунетность" данного сайта: у "более рунетного" сайта ТИЦ будет больше
медианного.
Выводы
БлагодарностиАвтор благодарит Константина Рощупкина за конструктивную критику. |
Казимир Малевич, дизайн Владимир Липка, тоже |
|
|
Спонсоры проекта | ||
---|---|---|
Новости правительство москвы Ефимов Владимир Владимирович заместитель мэра Москвы. | Агрегатор соцсетей | belka digital. | Наши спиннинговые удочки обеспечат вам отличный улов всегда! | Здесь изготовление рекламных вывесок раменское. | Спасите мои бизнес алла милютина. |
Indexed: Ap:2010-11-01 20:49 | G:2025-02-05 11:39 | MSN:2012-05-29 04:59 | R:2011-06-16 01:12 | Yah:2018-02-17 09:22 | Я:2013-08-30 06:14 |