Особенности сооружения опор в сложных условиях: Сооружение ВЛ в районах с суровыми климатическими и тяжелыми геологическими условиями...
Биохимия спиртового брожения: Основу технологии получения пива составляет спиртовое брожение, - при котором сахар превращается...
Топ:
Устройство и оснащение процедурного кабинета: Решающая роль в обеспечении правильного лечения пациентов отводится процедурной медсестре...
Характеристика АТП и сварочно-жестяницкого участка: Транспорт в настоящее время является одной из важнейших отраслей народного хозяйства...
Отражение на счетах бухгалтерского учета процесса приобретения: Процесс заготовления представляет систему экономических событий, включающих приобретение организацией у поставщиков сырья...
Интересное:
Что нужно делать при лейкемии: Прежде всего, необходимо выяснить, не страдаете ли вы каким-либо душевным недугом...
Берегоукрепление оползневых склонов: На прибрежных склонах основной причиной развития оползневых процессов является подмыв водами рек естественных склонов...
Национальное богатство страны и его составляющие: для оценки элементов национального богатства используются...
Дисциплины:
|
из
5.00
|
Заказать работу |
Содержание книги
Поиск на нашем сайте
|
|
|
|
Количество информации, размещенной в Интернете, постоянно увеличивается. В связи с этим возникает проблема поиска данных.
В Интернете существует два типа поисковых систем - классификаторы и поисковые машины. В зависимости от информации, которую необходимо найти, удобнее воспользоваться поисковой системой того или иного типа.

Рис. 7.4. Домашняя страница одного из самых первых классификаторов Yahoo!
Классификаторы хранят упорядоченные списки ссылок на Web-узлы. Обычно каждой ссылке сопутствует краткое описание. Списки упорядочены по тематическим разделам на поисковом сервере. Эти списки образуют иерархическую древовидную структуру. Спускаясь по дереву каталогов, можно последовательно ограничить область поиска и, в конечном итоге, получить список ссылок на Web-узлы, связанные с той темой, которая интересна пользователю.
Использовать классификаторы удобно в том случае, когда тема для поиска достаточно общая. Например, "Вузы Санкт-Петербурга" или "Авиационная промышленность". В первом случае искомый ресурс, скорее всего, будет размещен в разделе "Образование: Вузы: Вузы Санкт-Петербурга", а во втором - в разделе Промышленность: Машиностроение: Авиационная промышленность. При использовании для поиска информации классификаторов необходимо достаточно четко представлять, к какой категории эта информация относится. Кроме того, классификация ресурсов проводится людьми, поэтому часто бывает достаточно субъективна.

Рис. 7.5. Популярный российский классификатор List.ru
Этими недостатками не обладает другой тип поисковых систем - поисковые машины. Поисковые машины просматривают страницы, размещенные в Интернете, и составляют индексы используемых слов. Пользователь вводит искомое слово, набор слов или логическое выражение, и по его запросу поисковая машина выдает список ссылок на страницы, в которых это слово используется.
Одним из основных элементов поисковых машин является индексатор (иногда используется термин "паук") - программный модуль, периодически сканирующий Интернет для сбора данных о состоянии информационных ресурсов.
Эти данные используются для формирования и обновления индекса - массива данных поисковой машины, служащего для поиска адреса информационного ресурса. Основные составляющие индекса - это прямой и инвертированный списки, устанавливающие соответствие между поисковыми терминами и содержащими их документами.
Третий элемент поисковой машины - аппарат поиска, непосредственно обеспечивающий работу пользователя с индексом. Под этим термином подразумевают информационно-поисковый язык системы, пользовательский интерфейс и механизмы осуществления запросов в индексной базе.

Рис. 7.6. Поисковая система AltaVista
Для того чтобы не увеличивать размеры словарей и индексов, введено такое понятие, как вес термина. Он определяется в процессе индексирования и зависит от метода индексирования, который используется данной поисковой машиной.
Методы индексирования делятся на статистические, теоретико-информационные и вероятностные.
В статистических методах документы рассматриваются как точки в информационном пространстве. Чем ближе группы терминов, составляющих документы, тем ближе находятся отображающие их точки. В качестве терминов индексации выбираются понижающие плотность пространства документов.
Теоретико-информационные методы основаны на предположении о том, что наибольшую информационную ценность имеют наименее часто встречающиеся слова. Для оценки полезности термина применяются концепции теории информации.
Вероятностные методы предполагают наличие обучающего множества документов для оценки релевантности результатов обработки запроса. Обучающее множество применяется для вычисления весовых коэффициентов, получаемых путем оценки условной вероятности вхождения термина в данный документ в случае его релевантности (или нерелевантности). На основе этих коэффициентов определяется вес термина.

Рис. 7.7, Форма для запроса на российском поисковом сервере Rambler
При построении индекса реальные документы заменяются поисковыми образами документов. При индексирования нетекстовой информации в поисковые образы входят главным образом универсальные адреса ресурсов, в случае новостей и почтовых списков - поля Subject и Keywords. Из составляющих HTML-документы слов в поисковые образы обычно входят имеющие наибольший вес.
Формальную релевантность вычисляет система, на основании чего ранжируется выборка найденных документов. Реальная релевантность - это оценка самим пользователем ценности найденных документов.
Некоторые поисковые машины показывают дату, когда был проиндексирован тот или иной документ. Это помогает пользователю понять, насколько актуальным является ресурс, ссылку на который выдает поисковая машина. Часто поисковые машины не включают определенные слова в свои индексы или могут не включать эти слова в запросы пользователей. Такими словами обычно считаются предлоги или просто очень часто использующиеся слова. Не включают их ради экономии места на носителях.

Рис. 7.8. Форма для запроса на российском поисковом сервере Яndex
В последнее время Web-серверы, предназначенные для поиска информации в Интернете, сочетают в себе возможности классификаторов и поисковых машин.
|
|
|
Организация стока поверхностных вод: Наибольшее количество влаги на земном шаре испаряется с поверхности морей и океанов (88‰)...
Адаптации растений и животных к жизни в горах: Большое значение для жизни организмов в горах имеют степень расчленения, крутизна и экспозиционные различия склонов...
Семя – орган полового размножения и расселения растений: наружи у семян имеется плотный покров – кожура...
Кормораздатчик мобильный электрифицированный: схема и процесс работы устройства...
© cyberpediasu.com 2017-2026 - Не является автором материалов. Исключительное право сохранено за автором текста.
Если вы не хотите, чтобы данный материал был у нас на сайте, перейдите по ссылке: Нарушение авторских прав. Мы поможем в написании вашей работы!