Итак, где же найти необходимую информацию? Можно пытаться найти знающего человека (эксперта) и получить так называемую первичную информацию. Можно пойти в библиотеку или пробовать найти подходящий справочник. А можно искать решение во Всемирной паутине.
Интернет представляет собой совокупность компьютерных сетей, которая содержит свыше 20 миллионов баз данных. В них на сегодняшний день хранится огромное количество документов – 1012. Причем, по некоторым оценкам, объем Интернета удваивается каждые три года.
Доступ к текстам через Интернет возможен в основном тремя способами: по гипертекстовым ссылкам, через поисковые каталоги и посредством поисковых систем и баз данных.
Три способа поиска информации в Сети
Ходить по гипертекстовым ссылкам среди миллиардов документов в поисках нужного – дело совершенно безнадежное. Однако гипертекст может оказать неоценимую помощь при сборе латентной (скрытой) информации об изучаемом объекте, которую никакими другими методами поиска получить нельзя. Такой способ называется обратной стратегией поиска. Для его реализации используется оператор link поисковых систем. Он обеспечивает нахождение всех страниц, ссылающихся на объект исследования. Например, поисковые сервера
по запросу: link:www.berator.ru выдадут подборку страниц, ссылающихся на любую страницу сайта http://www.berator.ru. Для поисковой системы «Яндекс» аналогичный запрос имеет несколько другую запись: #link="www.berator.ru*"
Поиск в интернет-каталогах, как правило, непродуктивен. Крупнейший из них – проект «Открытый каталог». Он содержит информацию о 4 миллионах сайтов в 590 тысяч рубрик. Проект поддерживают свыше 67 тысяч редакторов-добровольцев. Естественно, он наследует все пороки библиотек. Полнота представления информации в каталогах чрезвычайно низкая. Кроме того, средняя задержка с момента опубликования документа в Сети до момента его учета в каталогах может составлять кварталы.
Полнотекстовый поиск – еще один способ доступа к нужной информации через Интернет. Крупнейшие зарубежные поисковые системы Интернета и службы баз данных обеспечивают оперативный доступ к огромному количеству документов. Например, «Гугл» – к 8 миллиардам, а одна из крупнейших коммерческих служб баз данных «Лексис-Нексис» – к 4,5 миллиарда текстов в 30 тысяч баз данных.
Национальные ресурсы Интернета также весьма солидны. В частности, «Яндекс» имеет объем основной базы известных русскоязычных документов более 320 миллионов. А крупнейшая коммерческая служба баз данных «Интегрум» – более 75 миллионов единиц хранения. В отличие от поисковых каталогов нахождение новых документов и их учет в полнотекстовых базах данных производится автоматически программами-роботами. Полнота даже самых объемных баз данных составляет доли процента от числа доступных через Интернет текстов.
Для систем полнотекстового поиска среднее время задержки доступности для поиска нового документа с момента его публикации в Сети варьируется от нескольких минут до месяцев. Минимальную задержку обеспечивают так называемые агрегаторы новостей. Например, британский сервер «Новости сейчас» индексирует почти 20 тысяч источников новостей с задержкой пять минут. Поисковые системы сайтов обеспечивают доступ к новой информации на сайте с опозданием, как правило, не более суток. Поисковые системы общего назначения вынуждены перекачивать огромные объемы информации, и поэтому обеспечивают доступ к ней с запаздыванием в десятки дней и месяцы: «Яндекс» – 14 дней, «Гугл» – 30 дней.
Итак, мы разобрались в том, что по существу единственный способ доступа к проблемно ориентированной информации через Интернет – это полнотекстовый поиск.
Где искать?
Заметная доля (более 97 процентов) нужных документов по разным причинам не попадает в поле видения заинтересованных пользователей и условно называется «невидимый Интернет». Невидимой эта часть Интернета является не потому, что там нельзя увидеть нужный документ, а потому, что доступ осуществляется в два этапа. Сначала требуется подобрать подходящие поисковые системы и базы данных, затем суметь найти в этих коллекциях требуемые материалы.
Для построения реестра открытых источников может применяться приведенная ниже классификация и один из 12 способов построения реестра проблемно ориентированных ресурсов Интернета – авторские поисковые шаблоны. Работа с конкретным шаблоном состоит в его загрузке в текстовый редактор (Блокнот, MS Word...), замене всех значений параметров (начинаются со знака «#») на характерные для специализации базы данных слова. Например, #отрасль заменить на нефтехимия, а #отраслевой на нефтехимический. Затем получившийся запрос использовать для поиска.
Один из шаблонов «Рамблера» для поиска средств массовой информации:
(4,(#отрасль || #отраслевой) & (брошюра || бюллетень || ведомости || вести || вестник || газета || дайджест || ежемесячник || ежемесячный || еженедельная || еженедельник || журнал || записки || издание))
Пояснение: «Рамблер» по запросу брошюра || бюллетень || ведомости находит все тексты, содержащие любые словоформы «брошюра» или «бюллетень» или «ведомости». «Рамблер» по запросу 4, нефтехимия & брошюра находит все документы, включающие одновременно любые словоформы «нефтехимия» и «брошюра» рядом в любом порядке (в группе из 4 смежных слов).
Один из шаблонов «Гугл» для поиска баз данных:
#отрасль OR #отраслевой "расширенный поиск" OR "базы данных" OR "база данных" OR "поисковая система"
Перечислим некоторые классы лучших в своем роде открытых источников, часто используемых для поиска информации о конкретном объекте или для разрешения проблемной ситуации.
Класс 1. Национальные и глобальные метапоисковые системы общего и специального назначения: IxQuick, «МетаБот», глобальный патентный метапоиск SurfIP... Метапоиск – параллельный поиск по нескольким базам данных с формированием сводного результата.
Пример проблемы. Найти учебник НАТО по использованию Интернета для военной разведки (английский язык, IxQuick):
intelligence exploitation of the internet
Пояснение: все поисковые системы имеют свои правила написания запросов (обычно фирменное описание дается на сайте). По умолчанию IxQuick найдет тексты, содержащие все слова запроса. Если между ключевыми словами стоит пробел, поисковая система, как правило, воспринимает его как требование одновременного присутствия в тексте обоих терминов.
Класс 2. Глобальные поисковые системы и службы баз данных общего назначения: «Гугл», AllTheWeb, «Яху», «Лексис-Нексис» ...
Пример проблемы. Мониторинг сайтов конкурентов (английский язык, «Гугл»):
competitors-web-sites OR competitor-web-site monitor OR monitors OR monitoring
Пояснение: «Гугл» по запросу duty-free находит все документы, содержащие фразу "duty free"; по запросу персонал OR сотрудники находит все тексты, включающие любую из заданных словоформ.
Пример проблемы. История радиовещания в Австрии (немецкий язык, AllTheWeb – булевый расширенный поиск):
("Osterreicher Rundfunk" OR "Oster- reichischer Rundfunk") AND (Abwi-cklung OR Behandlung OR Chronik OR Chronologisch OR Entfaltung OR Entstanden OR Entstehen OR Entstehung OR Entwicklung OR Intensivierung OR Epoche OR Evolution OR Geschichte OR Historische OR Historischer OR Histori-sches OR Periode OR Periodendauer OR Zeitdauer).
Пояснение: AllTheWeb по запросу Osterreicher Rundfunk находит все документы, содержащие в тексте требуемую последовательность заданных словоформ "Osterreicher Rundfunk" (точную фразу). AllTheWeb по запросу Rundfunk AND Abwicklung находит все документы, содержащие в тексте все требуемые словоформы "Rundfunk" и "Abwicklung".
Класс 3. Национальные поисковые системы и службы баз данных общего назначения: «Яндекс», «Рамблер», «Интегрум», Публичная интернет-библиотека...
Пример проблемы. Стратегии портфельного инвестирования («Интегрум»):
((стратегия или субстратегия) (Dow или Forex или арбитражер или аукцион или биржа или биржевой или брокер или брокерский или валютный или вексель или вексельный или голубые :2 фишки или денежный или индексного :2 фонда или кривая :2 (доходности или доход) или ММВБ!Т или облигация или пассивное :2 управление или портфель или портфельный или РТС!Т или рыночного :2 опережения или спекулятивный или спекуляция или спекулянт или трейдер или фондовый или хедж или хеджер или хеджирование или ценные :2 бумаги) \\с10)
Пояснение: Поисковая система «Артефакт» («Интегрум») по запросу Dow или Forex находит все тексты, содержащие либо слово «Dow», либо «Forex», либо оба слова. «Артефакт» сначала выполняет инструкцию запроса во внутренних круглых скобках, затем все прочие «вышестоящие» инструкции. «Артефакт» по запросу голубые :2 фишки находит все документы, включающие последовательность любых словоформ в одном предложении, причем за словом «голубые» следует слово «фишка», а между ними может попасть не более двух слов.
По запросу ММВБ!Т «Артефакт» находит все документы, содержащие сокращение «ММВБ» без словоизменений.
А по запросу стратегия портфельный \\с10 «Артефакт» найдет все тексты, включающие хотя бы одно предложение с любыми словоформами "стратегия" и "портфельный" в любом порядке в группе из 10 смежных слов.
Класс 4. Глобальные агрегаторы новостей: DayPop (http://www.daypop.com/advanced), «АльтаВиста-Новости» (http://www.altavista.com/news/) и проч.
Пример проблемы. Последняя информация о внешнем долге России (английский язык, DayPop): debt Russia
Пример проблемы. Новые материалы об отмывании российских денег за рубежом (английский язык, «АльтаВиста-Новости»):
russia* OR Moscow AND money-laundering
Пояснение: «АльтаВиста» по запросу russia* (шаблон «*» в конце слова) находит все документы, содержащие после требуемого начала слова от нуля до пяти любых символов (пробелы и спецсимволы не допускаются). Например, «russia», «russian», «russians».
Класс 5. Национальные агрегаторы новостей: «Яндекс-Новости» (http://news.yandex.ru), «Рамблер-Медиа» (http://www.rambler.ru/db/news/) и проч.
Пример проблемы. Новости враждебных поглощений («Яндекс-Новости»):
((поглощение | захват | поглотить | аквизиция) /3 (враждебный | недружественный | агрессивный) ~ (агрессивный /3 захват))
Пояснение: «Яндекс» по запросу аквизиция /3 враждебный находит все тексты, содержащие в произвольном порядке любые словоформы «аквизиция» и «враждебный» в группе из четырех смежных слов одного предложения (число «3» означает максимальную разницу порядковых номеров слов в предложении, взятую по модулю). А по запросу поглощение ~ агрессивный «Яндекс» находит все документы, включающие любые словоформы «поглощение», причем в этом же предложении должна отсутствовать любая словоформа слова «агрессивный».
Пример проблемы. Новинки прикладных программ учета труда и заработной платы («Рамблер-Медиа»):
(7,(программа || компьютерный || компьютер || (2,банк & данных) || ИБ) & (6,(учет || учитывание || учитывать || планирование || планировать || бухучет || аудит || управление || управлять || менеджмент) & (труд || трудовой || персонал || кадры || кадровый || зарплата || оплата || (2,заработный & плата) || тариф || тарифный || тарификация || ставки || расценки || оклад)))
Пояснение: «Рамблер» по запросу компьютерный || компьютер находит все тексты, содержащие любые словоформы «компьютер» или «компьютерный». «Рамблер» по запросу (2,заработный & плата) находит все документы, включающие одновременно любые словоформы «заработный» и «плата» рядом в любом порядке (в группе из двух смежных слов).
Класс 6. Национальные специализированные базы данных и источники новостей, которые содержат информацию о заданном классе объектов исследования (по отраслям промышленности, типам документов и т. п.). Например, Федеральный регистр Минюста России (http://sakhjust.snc.ru/registr.html) обеспечивает доступ к правовым актам субъектов Федерации. А правительственный портал FirstGov (http://www.firstgov.gov/) – к официальным документам США уровня штатов и выше. Один из самых популярных порталов по вопросам налогообложения и бухгалтерского учета в России – «Бухгалтерия.Ру» (http://www.buhgalteria.ru).
Пример проблемы. Налогообложение и бухучет в филиалах («Бухгалтерия.Ру»): филиал
Пример проблемы. Правовые акты о налогах Чеченской Республики (в Федеральном регистре Минюста России – регион № 20):
Класс 7. Глобальные специализированные базы данных и источники новостей, не привязанные к территории и содержащие информацию о заданном классе объектов исследования (по отраслям промышленности или знаний, по типам документов или источников и т. п.):
Пример проблемы. Снижение содержания радона в питьевой воде (английский язык, Химический портал):
radon water reduction
Класс 8. Информационные ресурсы территорий, где какое-то время присутствовал или в настоящее время находится объект исследования. Например, телефонные справочники организаций города Жиздра Калужской области (http://www.zhizdra.ru/ Files/telefon.htm) и частных лиц (http://zhizdra.narod.ru/help/person-phones/a.htm) позволяют уточнить телефон любой организации или частного лица этого города с населением 5500 человек.
Класс 9. Иные базы данных (вакансии, выставки, форумы, реестры предприятий, библиография, пресс-релизы и т. п.) автор объединил в специализированную базу данных. Авторская база «Рабочее место аналитика» содержит в 350 классах систематизированные описания более 7000 баз данных и включает более 500 шаблонов для решения разнообразных задач, в частности для поиска подходящих открытых источников. Ведется работа над созданием системы из 1500 реестров баз данных городов России (по классификатору ОКАТО) и отраслевых поисковых систем (по классификаторам ОКВЭД, ОКП, ОКУ, ОКДП и проч.), в каждом из которых обычно находится от 10 до 70 баз данных.
Алгоритм поиска
Общая процедура поиска решений «проблемы по аналогии» может состоять из следующих этапов.
Этап 1. Запишите проблему, как она дана. Пробуйте переформулировать ее другими словами и для каждой новой формулировки проведите отдельный поиск.
Этап 2. Воспользуйтесь метапоиском или откройте поисковую систему Интернета с большим объемом индекса. В дальнейшем, если позволяет время, постройте реестр проблемно ориентированных баз данных (см. выше) и подготовьте запросы для каждой из них.
Этап 3. Примените «правило гармонии». Оно заключается в том, чтобы последовательно добавлять в поисковый запрос слова из формулировки «проблемы, как она дана», начиная с первого – самого уникального или значимого. А затем нужно постепенно добавлять в запрос иные слова из формулировки в порядке снижения их существенности. Например, по проблеме незаконного вывоза урана из России сформировать запрос можно следующим образом («Яндекс»):
Этап 4. По мере необходимости расширяйте существенные понятия (с третьего этапа) иными частями речи, словоформами, синонимами, антонимами, ошибочными написаниями и проч. (известно более 40 видов лексических расширений).
Пример проблемы. Незаконный вывоз урана из России («Яндекс», предыдущий пример):
((+(((вывоз | вывозить | экспорт | экспортировать | транспортировать | транспортировка | экспедировать | экспедирование | перевозить | перевозка) /5 (незаконный | нелегальный | не-законный | не-легальный | преступный | запрещенный | криминальный)) | контрабанда | контрабандный) & + (уран | урановый | ураносодержащий | урано | уранилы | uranium | уранинит | настуран)) & +(из /(+1 +2) (россия | !рф | российский) | зарубеж | за-рубеж | заграницу | за-границу))
Пояснение: «Яндекс» по запросу !рф находит все тексты, содержащие точную словоформу сокращения «РФ» (без словоизменений). Одно из значений модификатора «+» перед круглыми скобками в языке запроса в «Яндекс» – требование точно выполнять условия запроса, что обычно дает заметно меньше документов. В данном запросе – искать в одном предложении.
Этап 5. Если добавляемое слово многозначно, уточняйте нужный смысл, добавляя дополнительные операнды (таким образом вы зафиксируете нужные контексты). Либо «отрезайте» неподходящие контексты при помощи операторов исключения.
Пример проблемы. Деловая разведка («Яндекс», добавили уточняющие слова):
разведка /3 (деловая | бизнес | конкурентов | конкурентная)
Пример проблемы. Качество в смысле степени совершенства («Яндекс», исключили неподходящий смысл слова «качество»):
качество ~/(-2 -1) +в
Пояснение: «Яндекс» по этому запросу найдет все документы, содержащие хотя бы одно предложение с любой словоформой «качество», перед которой нет предлога «в» (на предыдущей и через одну позициях).
Этап 6. Увидев подходящий фрагмент текста, прекращайте дальнейший просмотр результатов поиска, запишите его в отчет, распечатайте и проанализируйте.
Этап 7. Если в результате поиска ничего полезного не найдено, не отчаивайтесь. Попробуйте какое-либо из следующих действий:
Этап 8. Если найдено много полезных документов, но их полная обработка затруднена. В этом случае ищите аналитические материалы.
Когда описание проблемы встречается в тексте неоднократно, можно предположить, что это обзор или история изучаемого вопроса. Чтобы найти такой материал, можно, например, воспользоваться формулой запроса «Яндекс» для поиска многократных (не менее 8) цитирований:
+(#проблема) &&/(+1 +10) + (#проблема) &&/(+1 +10) + (#проблема) &&/(+1 +10) + (#проблема) &&/(+1 +10) + (#проблема) &&/(+1 +10) + (#проблема) &&/(+1 +10) + (#проблема) &&/(+1 +10) + (#проблема)
Пояснение: «Яндекс» по запросу проблема &&/(+1 +10) проблема найдет все документы, содержащие «проблему» в соседних предложениях или в группе, состоящей не более чем из 11 смежных предложений.
Формула запроса используется аналогично поисковому шаблону:
#проблема заменяется на мотивация-персонала или любую другую формулировку.
Дополнительная проверка
В заключение заметим, что верить нельзя ничему. При работе через Интернет нам в большинстве случаев помогает многочисленность открытых источников или каналов распространения информации. Но всю собранную информацию необходимо проверять на достоверность. В частности, рекомендуется изучить публичные базы данных регистраторов доменных имен. Например, через сайт ООО «РегТайм» (http://www.webnames.ru/) можно проверить, на кого зарегистрирован сайт в зонах RU, SU, INFO, COM, NET, ORG, BIZ, NAME, WS, BZ, TC, GS, MS, VG, US, BE, IT, CC, TV.
Если же найденные через Интернет данные сомнительны или единичны, то рекомендуется проводить дублирующие друг друга активные мероприятия (звонки по телефону, выезд на место, звуко- и видеозапись, фотосъемка, требование документов и т. п.).