Internet Archive закачає на Flickr понад 14 млн вільних історичних зображень

Internet Archive закачає на Flickr понад 14 млн вільних історичних зображень

Один з працівників Internet Archive розробив програму для автоматичного вилучення ілюстрацій з мільйонів книг у процесі OCR-сканування, яке зараз здійснює Internet Archive. Калев Літару (Kalev Leetaru) використовував існуючий додаток розпізнавання тексту: він спочатку визначає межі ілюстрацій, щоб відкинути ілюстрації перед OCR. Але навіщо матеріалу зникати?


Всі вилучені ілюстрації були вирівняні, кадровані, очищені і закачані на фотохостинг Flickr з супровідним текстом з книги. Таким чином, можливий повнотекстовий пошук за архівом ілюстрацій Internet Archive Book Images, які знаходяться в суспільному надбанні.

Всього на Flickr закачають 14 млн картинок (на даний момент закачано 2,6 млн).

Галерея картинок зі старих книг - дуже захоплююча справа. Тут можна знайти і пейзажі, і ілюстрації з кулінарної справи, і ноти, і картинки з медичних довідників, і старі карти. Каталог ілюстрацій запрошує до своєрідної «подорожі в часі»: введіть якийсь термін (телефон, літак) - і побачите, як ця річ виглядала раніше.

Багато картинок - це якісь дивні незрозумілі об'єкти з минулого. Без опису і не зрозумієш, що це таке.

Мабуть, редактори Вікіпедії знайдуть відповідний ілюстративний матеріал, щоб поповнити багато історичних статей.

Для кожної ілюстрації вказано назву книги, рік її видання і сторінку, на якій зустрілася ілюстрація. Є посилання, щоб прочитати книгу в онлайні (всі вони опубліковані на сайті Internet Archive). У рамках цього проекту оцифровано вже 600 млн сторінок.

Кожен бажаючий може робити з цими зображеннями що завгодно, включаючи використання в некомерційних або комерційних цілях, повторну публікацію, редагування тощо.