Классификация поисковых систем по авторитетности:
- Alta Vista (http://www.altavista.com);
- HotBot (http://www.hotbot.com),
- Northern Light (http://www.northernlight.com),
- Excite (http://www.excite.com),
- InfoSeek (http://www.infoseek.com),
- Lycos (http://www.lycos.сom).
Российские системы этого класса представляют:
- Rambler (http://www.rambler.ru),
- Апорт (http://www.aport.ru),
- Яndex (http://www.yandex.ru).
Абсолютно все всемирно известные справочники и поисковые системы в настоящее время превратились во внушительные корпорации с ежегодными многомиллионными доходами. Заработав авторитет наиболее посещаемых мест в Сети, они предоставляют свои страницы для размещения рекламной информации, доходы от которой и составляют основу их бюджета. Постепенно поисковые серверы превращаются в образования, именуемые "портал", где поисковый сервис является главной приманкой для пользователей, но далеко не единственной из предоставляемых услуг. Помимо разыскания информации, такие серверы обычно предоставляют пользователям бесплатную электронную почту, возможность размещать свои страницы, а также сведения о погоде, текущих новостях, биржевые котировки, карты местности (США и Канада) и т.д.[9, с 80]
На сегодняшний день поисковые системы - самые популярные страницы сети, на которых пользователи проводят очень много времени. Поэтому, все большее значение при выборе поисковой системы приобретают сопутствующие сервисы (почта, новостные ленты, торговые площадки и т.п.). Все это выглядит достаточно просто, но на самом деле здесь есть проблемы. Основная проблема современного Интернета связана с изобилием Web-страниц. Достаточно ввести в поле поиска такое простое слово, как, например, футбол, и российская поисковая система выдаст несколько тысяч ссылок, сгруппировав их по 10-20 штук на отображаемой странице.
По данным статистики, клиенты просматривают не более 50 ссылок, стоящих первыми, при этом, не обращая внимание на остальные. Однако клиентов беспокоит качество самых первых ссылок. Клиенты не любят, когда в первом десятке встречаются ссылки, утратившие актуальность, когда подряд идут ссылки на соседние файлы одного и того же сервера. Самый плохой вариант - когда подряд идут несколько ссылок, ведущих к одному и тому же ресурсу, но находящемуся на разных серверах.
Для решения данной проблемы, широко применяются технологии искусственного интеллекта, результатом работы которых является список найденных ссылок, отсортированных по качественности их ресурсов.
Строго говоря, все поисковые системы извлекают исходную информацию из одного и того же Web-пространства, поэтому исходные базы данных у них могут быть относительно похожи. И лишь на третьем этапе, при выдаче результатов поиска, каждая поисковая система начинает проявлять свои лучшие (или худшие) индивидуальные черты. Операция сортировки полученных результатов называется ранжированием. Каждой найденной Web-странице система присваивает некоторый рейтинг, который должен отражать качество материала. Но качество - понятие субъективное, а программе нужны объективные критерии, которые можно выразить числами, пригодными для сравнения.
Высокие рейтинги получают Web-страницы, у которых ключевое слово, использованное в, запросе, входит в заголовок. Уровень рейтинга повышается, если это слово встречается на Web-странице несколько раз, но не слишком часто. Благоприятно влияет на рейтинг вхождение нужного слова в первые 5-6 абзацев текста - они считаются самыми важными при индексации. По этой причине опытные Web-мастера не дают в начале своих страниц таблицы. Для поисковой системы каждая ячейка таблицы выглядит, как абзац, и потому содержательный основной текст как бы далеко отодвигается назад (хотя на экране это и не заметно) и перестает играть решающую роль для поисковой системы.
Очень хорошо, если ключевые слова, использованные в запросе, входят в альтернативный текст, сопровождающий иллюстрации. Для поисковой системы это верный признак того, что данная страница точно соответствует запросу. Еще одним признаком качества Web-страницы является тот факт, что на нее есть ссылки с каких-то других Web-страниц. Чем их больше, тем лучше. Значит, эта Web-страница популярна и обладает высоким показателем цитирования. Самые совершенные поисковые системы следят за уровнем цитирования зарегистрированных ими Web-страниц и учитывают его при ранжировании.
Создатели Web-страниц всегда заинтересованы в том, чтобы их просматривало больше людей, поэтому они специально готовят страницы так, чтобы поисковые системы давали им высокий рейтинг. Хорошая, грамотная работа Web-мастера способна значительно поднять посещаемость Web-страницы, однако есть и такие «мастера», которые пытаются обмануть поисковые системы и придать своим Web-страницам значимость, которой в них на самом деле нет. Они многократно повторяют на Web-странице какие-то слова или группы слов, а для того чтобы те не попадались на глаза читателю, либо делают их исключительно мелким шрифтом, либо применяют цвет текста, совпадающий с цветом фона. За такие «хитрости» поисковая система может и наказать Web-страницу, присвоив ей штрафной отрицательный рейтинг.
В последние годы сложилась практика коммерческого рейтингования. Технически поисковые системы оснащены самыми современными средствами, соответствующими уровню 2008 года, а общий размер Российского сектора Интернета сегодня примерно таков, каким был западный сектор в 1994-1995 гг. Поэтому сегодня в России особых проблем с поиском информации нет и в ближайшее время они не предвидятся. А в западном секторе проблемы с поиском очень большие, и разные поисковые системы пытаются по-разному их преодолеть. [10,с 124]
Пути решения вышеобозначенных проблем рассмотрим далее.
Из поисковых указателей в России сегодня действуют три «кита» (есть и более мелкие системы, но мы останавливаться на них не будем). Это «Рамблер» (www.rambler. ru), «Яндекс» (www.yandex. ru) и «Апорт2000» (www.aport. ru).
Исторически наиболее популярной поисковой системой является «Рамблер». Она начала работать раньше других и долгое время лидировала по размеру поискового указателя и качеству услуг поиска. Но, сегодня, эти достижения в прошлом. Несмотря на то, что размер поискового указателя «Рамблер» примерно равен 12 миллионам Web-страниц, он давно не обновляется и выдает устаревшие результаты. Сегодня «Рамблер» -это популярный портал, лучшая в России классификационно-рейтинговая система и рекламная площадка. Традиционно эта система держит первое место в России по посещаемости и имеет хорошие доходы от рекламы. Но в развитие средств поиска средства не вкладываются. [9, с 96]
Самый большой указатель лежит в основе системы «Яндекс» - примерно 27 миллионов Web-страниц, но дело не только в размере. Это не просто указатель на ресурсы, а указатель на самые актуальные ресурсы. По уровню актуальности «Яндекс» сегодня - безусловный лидер. [6, с 142]
Система «Апорт» выигрывает на третьем этапе: в момент представления информации клиенту. Она не стремится к созданию самого большого указателя автоматическими средствами, а вместо этого широко использует информацию из каталога @Rus, проходящую ручную обработку. Поэтому система выдает не так много результатов, как ее ближайшие конкуренты, но зато эти результаты, как правило, точны и наглядно представлены
Начиная поиск чего-либо в Internet и имея минимум информации, а так же пытаясь ограничить потери времени, для получения наиболее общей информации возможно обращение к следующей базе данных.
Основные особенности поисковой системы Апорт:
1. База данных: предмет ведет к Межсетевым ресурсам, построенным библиотекарями.
2. Содержание: Свыше 2,500 связей с Internet ресурсами, кратко аннотируемыми, с указанными предметными заголовками.
3. Поиск: Поиски могут быть ограничены названием ресурса, описанием его, или с указанными предметными заголовками.
4. Результаты: Результаты показаны в алфавитном порядке названиями ресурса.
5. Адрес: http://sunsite.berkeley.edu/InternetInd ex.
6. Частота Модернизации: ежедневно. [2, с 280]
Yahoo! - самая известная поисковая машина, была основана в 1994, и на сегодняшний день это самый старый и наиболее полный каталог Интернет-ресурсов. Популярная система, обслуживающая миллионы запросов ежедневно, зародилась как простая коллекция закладок, которую пополняли всего 2 человека - Дэвид Фило и Джерри Янг.
Yahoo! является наиболее популярным поисковым средством. Поисковая система содержит в штате 150 редакторов, для того, чтобы составлять и редактировать содержимое своих каталогов. Поисковая система имеет базу данных в более чем 1 млн. проиндексированных сайтов. Также, если недостаточно своей собственной базы данных, она использует базу данных Google (до июля 2000 года Yahoo! пользовался базой данных Inktomi).
Сайты поисковой системы разделены по категориям и ключевым словам. Они содержат полезную информацию на своей домашней странице. Могут подключаться к другим поисковым машинам.
Основные особенности поисковой системы Yahoo!:
1. Базы данных: в ведении находится служба поиска Internet-ресурсов, новостей, карт, рекламных информаций, спортивная информация, бизнес, номера телефонов, персональные WWW-страницы, и email-адреса (отдельная база данных).
2. Содержание: Основная директория содержит: адреса (URLs) для Internet-ресурсов и краткое описание для этих связей.
3. Поиск: Все Yahoo! страницы предлагают не только простое поисковое окно, но и опции для этого поиска, а так же поиск Usenet или Email-адреса. Поиск может ограничиваться указанием определённого промежутка времени. Boolean операторы (и, или) и последовательный поиск также поддержаны. Отметим: если поиск в Yahoo! не привёл к положительному результату, то процесс поиска автоматически переходит на Alta Vista, поисковая система продолжает поиск, и в случае положительных результатов автоматически возвращает найденную информацию в Yahoo!.
Если Yahoo! не может установить связь достаточно быстро с Alta Vista, то в этом случае Yahoo! будет обеспечивать страницу связи с набором инструментов поиска. После того как одна из этих связей выбирается, ключевые слова передаются к поисковой машине на ваше усмотрение.
Средством, облегчающим поиск, является наличие “tip search”(TS) - поиск с помощью “намека”: Yahoo! Является подчиненным справочником, это означает, что система не имеет так много страниц, как поисковые машины, однако задание наиболее общих ключевых слов позволит найти необходимую тему на странице высокого уровня (первая страница, которая возникает перед пользователем при посещении сайта) для организации или компании.
4. Результаты: Связи отображаются в соответствии с очерёдностью задаваемых слов последовательностью поиска наряду с их описательным текстом и подчиненной иерархией.
5. Адрес: http://www.yahoo.com.
6. Частота Модернизации: ежедневно. [7, с 214]
AltaVista начала предоставлять свои услуги в декабре 1995 года и на сегодняшний день является одной из наиболее крупных поисковых систем (по количеству проиндексированных страниц). Особенность этой поисковой системы заключается в возможность вести поиск по усложненным критериям отбора . Alta Vista также предлагает дополнительные услуги в виде поиска по каталогам (взятыми из Open Directory and LookSmart), а также службу под названием "Ask AltaVista" ("спроси AltaVista"), результаты которой берутся из Ask Jeeves. В настоящее время AltaVista владеет поисковой системой Raging Search.
Alta Vista поддерживает поиск по ключевому набору слов и для определения языка конкретной страницы использует методы искусственного интеллекта. Пользователи могут настроить опции поиска и выбирать тип поиска - сложный или упрощенный, а также воспользоваться различными способами предоставления информации. В отличие от машин, которые индексируют только ключевые слова, она индексирует весь текст, что позволяет осуществлять полный поиск.
Основные особенности поисковой системы Alta Vista:
1. Базы данных: Расположенные по всему миру WWW-страницы и Usenet News (новости).
2. Содержание: 31 миллион WWW-страниц (на май 2008 г.) и полный текст более чем 14,000 newsgroups обновленный в реальном масштабе времени.
3. Поиск: Предлагает простой (simple (S)) поиск или (much more advanced (MMS)),т.е. более передовой, способ. S - поиск стоит в основном использовать для общих вопросов, MMS - поиск использует специфический поисковый синтаксис. Для облегчения выполнения процедуры имеется подсказка (Simple Search Help). MMS - поиск, используя булинь(boolean), т.е. с помощью ключевых союзов, используя (and, or, not - (и, или, не)) и простую смежность (near - (около)) позволяет употреблять несколько слов, чередование слов, словосочетание в качестве ключевых для проведения поиска.
4. TS - поиск: Введением ключа типа: " Ваша Фраза " как первое направление поиска, который будет ограничивать число найденных WWW - документов с заголовками типа " Ваша Фраза ".
5. Результаты: Предлагает три выбора результатов (но два дают тот же самый результат):
1) "Стандартные"("Standard") - результаты, полученные машиной в виде списка параграфов, резюмируемые ей, с наличием URL - адреса, размером файла и последней датой модернизации. Результаты возвращаются как десять пунктов на экране.
2) "Компактный"("Compact") помещают каждый пункт в одной строке с последней датой модернизации картотеки.
3) "Детальный"("Detailed"), который является таким же самым, как и "Стандартный".
6. Адрес: http://altavista.digital.com.
7. Частота модернизации: Постоянно WWW-роботом.
Для анализа информации Excite использует поисковую технологию Intelligent Concept Extraction, что позволяет делать запросы по образцу. Это самая популярная поисковая система в Америке. Для каждой найденной страницы она оценивает степень соответствия запросу. [8, с 100]
Основные особенности поисковой системы Excite:
1. Базы данных: WWW-страницы по всему миру, новости, карты, "yellow pages" ("желтые страницы"), свободно распространяемое программное обеспечение, основные цитаты, программы телевидения, погоду,
е - mail адреса, рейсы авиалиний.
2. Содержание: 50 миллионов WWW-страниц и больше чем двухнедельный запас Usenet новостей.
3. Поиск: Предлагает только S - поиск, который поддерживает некоторые опции MMS - поиска.
TS - поиск: используйте плюс (+) чтобы определить, что все документы имеют данное слово, или используют минус (-) что бы уточнить, что ни один из документов не имеет данного слова. Возможно так же поддержка вoolean-операторами.
Вы можете использовать "AND", "OR" and "AND NOT"(И, ИЛИ и. И НЕ) операторы и круглые скобки для группировки. Например: (digital or virtual or electronic) AND library.
(цифровой или виртуальный или электронный) И библиотека.
4. Результаты: Результаты показаны с названием документа, разряд уместности в процентах, URL - адрес, резюме программного обеспечением документа, и опция, чтобы восстановить "More Like This"
("Скорее Этот "), которая позволяет использовать документ как ваш вопрос.
5. Адрес: http://www.excite.com/.
6. Частота Модернизации: Постоянно - WWW-роботом. [11, с 68]
Hot Bot для поиска в Интернете использует многопроцессорную параллельную обработку 10. млн. страниц ежедневно. Полезная сторона Hot Bot - ограничение на тип страниц по средствам выбора кнопок.
Основные особенности поисковой системы Hot Bot:
1. База данных: Расположенные по всему миру WWW-страницы.
2. Содержание: 54 миллиона WWW-страниц (на сентябрь 1996 г.).
3. Поиск: Предлагает S - поиск и Эксперт(Expert (Е))- поиск, поддерживает boolean-операторы (И и ИЛИ), поиск фразы, и выбор " человек "или" URL ". Е-поиск также поддерживает задание даты, местоположение (страна и т.д.)
TS - поиск: использует заключение фразы в двойные кавычки (например, " слова фразы ").
4. Результаты: Результаты показаны с названием документа, разряд уместности в проценте, URL, размер документа.
5. Адрес: http://www.hotbot.com.
6. Частота модернизации: Постоянно WWW-роботом ("Slurp"). [17, с 53]
Infoseek самая популярная поисковая машина в компьютерной индустрии. В мае 2006 она была признана самой достоверно предоставляющей информацию машиной. Привлекательность машины в том, что после отсеивания информации можно проверить найденную информацию ещё раз.
Основные особенности поисковой системы Infoseek:
1. Базы данных: расположенные по всему миру WWW-страницы, новости, запасает цитаты, карты, желтые страницы("yellow pages"),
e - mail адреса, и т.д.
2. Содержание: Главный база данных: 50 миллионов URL-адресов. (на сентябрь 2008 г)
3. Поиск: предлагает только простой S - поиск, но ключевые слова поиска могут быть ограничены специфическими полями (типа в пределах заголовков документа), поиск с использованием возможностей либо с исключением определённого слова (данному слову предшествует минус"-") или с включением требуемого слова (данному слову предшествует " + "). Для дополнительной информации относительно выбора поиска, используется. Infoseek-Помощь(Infoseek Help).
4. Результаты: Включает название документа, размер картотеки, URL, краткое резюме, извлеченное из документа, и разряд уместности в процентах.
5. Адрес: http://www.infoseek.com.
6. Частота Модернизации: Постоянно WWW-роботом.
7. Дополнительная информация: в случае большого количества информации см. http://info.infoseek.com/. [18, с 60]
Lycos - одна из первых поисковых машин. Машина удобна для работы с поиском и для одновременного просмотра сайтов. При выводе информации показывает краткий обзор, и найденные адреса.
Основные особенности поисковой системы Lycos:
1. Базы данных: расположенные по всему миру WWW-страницы, звуки, картины, "top 5% sites".
2. Содержание: 70 миллионов URL-адресов (на март 2008 г.).
3. Поиск: предлагает S - поиск и клиентурный(Custom (С)) поиск. С-поиск поддерживает boolean-операторы AND и OR (И и ИЛИ), также как некоторые другие назначения.
4. Результаты: результаты внесены в упорядоченный список; информация включает адрес документа (URL), название, размер файла, и выдержки из файла.
5. Адрес: http://www.lycos.com.
6. Частота модернизации: постоянно WWW-роботом. [19, с 200]
- Введение
- 1. Информационные системы
- 1.1 Понятие информационных систем
- 1.3 Классификация информационных систем
- 2. Информационно поисковые системы
- 2.1 Исторические предпосылки развития поисковых систем
- 2.3 Особенности поисковых систем
- 2.3.1 Первый закон Зипфа
- 2.3.2 Второй закон Зипфа "количество - частота"
- 2.4 Механизм работы поисковых систем
- 2.5 Основные параметры поисковых систем
- 2.6 Классификация поисковых систем по авторитетности
- Классификация поисковых систем по авторитетности:
- 2.7. Проблемы и возможности поисковых систем
- 3. Стратегия поиска
- 3.1 Последовательность действий
- Информационно-поисковая система
- Информационный поиск, информационно-поисковая система и его среда.
- Тема 1.Виды информационно-поисковых систем
- Информационно-поисковые системы
- 1. Информационно-справочные и информационно-поисковые системы
- Информационные системы и технологии
- Информационно-аналитические и справочно-поисковые системы
- Информационно–поисковые системы
- 5.3.3. Информационные средства обучения информатике
- 1.9. Информационно-поисковые системы Документальные информационные системы