Розробники з підрозділу краулінгу та індексації (Crawling and Indexing Team) повідомили про важливий експеримент, який почався зовсім недавно. Вони здійснили апгрейд краулера і почали випробовувати технологію інтелектуальної обробки HTML-форм. Після апгрейду робот-краулер повинен навчитися отримувати приховані URL-и і веб-сторінки, які генеруються у відповідь на обробку форм на різних сайтах і які неможливо отримати іншим шляхом.
На практиці технологія працює так: під час зустрічі з елементом обробник форм здійснює ряд пробних запитів. Для текстових полів у якості запитів автоматично вибираються слова з цього самого сайту, на якому знаходиться форма. Значення чекбоксів і спадних меню беруться безпосередньо з коду сторінки. Після цього програма намагається обробити отриманий URL. Якщо сторінка дійсно містить певний контент, її відправляють на індексування в загальний пошуковий індекс.
Незважаючи на уявну простоту і очевидність, обробка HTML-форм є дуже важливим кроком з витягування на світ так званої «Невидимої Мережі» (Deep Web) - величезних масивів інформації, які ховаються у великих базах даних, відкритих світу через інтерфейси HTML-форм. Це юридичні БД, різноманітні довідники (телефони, адреси, ціни) та інші масиви даних. За деякими оцінками, Невидима Мережа містить сотні мільярдів сторінок і охоплює 90% всього вмісту інтернету. Потрібно зауважити, що саме там приховується найцінніший контент, який досі не доступний через стандартні пошуковики.
Правда, в будь-якому випадку, величезний шматок Невидимої Мережі як і раніше залишиться за межами досяжності Google, тому що краулеру заборонено вводити які б то не було паролі або іншу персональну інформацію в поля форм: таке рішення розробників і керівництва Google. Адже дуже багато сайтів надають відкритий доступ до інформації тільки після безкоштовної реєстрації на сайті. Але з юридичної точки зору робот Google не має права створювати фіктивну особистість спеціально для реєстрації, тому що це є шахрайством і суперечить принципам завжди доброзичливого гуглоботу.
До речі, знаючі люди вже пояснили, звідки ростуть ноги у нової технології краулінгу. Швидше за все, її створила команда розробників з маленької компанії Transformic, яку Google придбала в 2005 році. Останні два з половиною роки вони наполегливо працювали, вдосконалюючи свою розробку і допомагаючи інтегрувати її в краулер Google.
