Аналоги web.archive.org. Как найти удаленные сайты?

Опубликовано: 2020-01-17

Веб Архив ( Archive.org) - самый известный и самый большой архив сайтов в мире. На их серверах сейчас находится более 400 миллиардов страниц. Существуют ли какие-либо системы, аналогичные Archive.org? Да, есть несколько альтернативных сервисов, но все они - лишь слабое подобие archive.org. Основным отличием Archive.org от всех альтернатив является размер. Веб Архив во много раз больше, чем все они вместе взятые.

Archive.is - Этот очень похожий на Веб Архив сервис. Archive.is (или archive.today) - некоммерческая организация, центр обработки данных которой находится во Франции. Служба позиционирует себя как капсулу времени, в которой хранится содержимое Интернета. Archive.is может сохранять не только статические веб-страницы с короткими URL-адресами, но и страницы, созданные в проектах Web 2.0, в том числе, например, карты Google. По сравнению с Archive.org этот веб-сервис обычно не индексирует сайты глубже чем первая страница. Archive.is не публикует точный размер кэшированных сайтов, но кажется, что их размер базы данных составляет всего несколько процентов от базы Archive.org.

GoogleCache Это не отдельный сервис, а просто кеш самой большой поисковой системы. В нем содержится много миллиардов страниц, но хранит он их не долго. Обычно кеш удаленного домена существует около месяца. Так что если домен был удален давно, то кеш не поможет. Cachedview.com, Cachedview.nl - системы просмотра кеша.

Так-же существует около 25 небольших клонов Archive.org, но они имеют весьма ограниченные базы данных. Этот сайт - timetravel.mementoweb.org является поисковой системой для подобных интернет архивов. Он тоже может помочь вам найти удаленный контент. Time Travel ищет кэшированные страницы в archive.org, archive.is и в некоторых странных местах, таких как Исландский интернет архив или Веб-архив Сингапура. Вы можете найти список существующих служб архивации на их сайте - http://timetravel.mementoweb.org/about/

В ближайшее время наша команда планирует запустить уникальный сервис, сочетающий в себе возможности системы Веб Архива (archive.org) и поисковой системы.

Использование материалов статьи разрешается только при условии размещения ссылки на источник: https://archivarix.com/ru/blog/wayback-machine-alternatives/

Бесплатные YouTube-инструменты на Tube Search: покадровый просмотр, теги, проверка имени канала и авторских прав

У Tube Search появился раздел бесплатных YouTube-инструментов. Это небольшие утилиты, которые решают конкретные повседневные задачи: рассмотреть видео покадрово, вытащить скрытые теги, проверить занят…

1 неделя назад
Как скачать субтитры с YouTube, даже с удалённых видео

Вы нашли на YouTube нужное видео, но не хотите его смотреть целиком ради пары фраз. Или вам нужен текст лекции, чтобы перевести его, процитировать или просто прочитать по диагонали. Субтитры YouTube р…

3 недели назад
Сколько живёт веб-страница: что говорят исследования о link rot

Откройте любую статью десятилетней давности и пройдитесь по ссылкам в ней. С большой вероятностью часть из них уже никуда не ведёт. Вместо нужной страницы вас встретит ошибка 404, припаркованный домен…

1 месяц назад
Archivarix Echo: проверьте 200+ веб-архивов одним запросом

Интернет постоянно осыпается. Страницы уходят в офлайн, аккаунты удаляют, статьи прячут за пейволл, проекты закрывают. Но копии чаще всего где-то остаются: Wayback Machine, archive.today, Common Crawl…

1 месяц назад
AI-саммари видео в Archivarix Tube Search

Когда вы находите удалённое видео YouTube через Tube Search, вы обычно получаете метаданные: название, описание, дату загрузки и иногда субтитры. Это уже полезно. Но чтение необработанных субтитров, ч…

4 месяца назад
Archivarix Tube Search - Поисковая система по удаленным видео YouTube

Tube Search - это поисковый движок по архивным данным YouTube. Сервис агрегирует информацию из нескольких публичных источников: Wayback Machine (Internet Archive), Common Crawl и различных собранных д…

4 месяца назад
Archivarix Broken Links Recovery: бесплатный плагин WordPress для поиска и восстановления битых ссылок

Со временем внешние ссылки в записях Wordpress неизбежно ломаются, страницы удаляются, домены истекают, видео становятся недоступными. Проверять сотни или тысячи ссылок вручную непрактично. Archivarix…

4 месяца назад
Как Internet Archive решает, что архивировать: приоритеты, частота, источники данных

Триллион сохранённых страниц. Более 99 петабайт данных. Сотни краулов, работающих каждый день одновременно. За этими цифрами стоит вопрос, который задаёт себе каждый, кто профессионально работает с ве…

5 месяцев назад
Как найти и купить истёкший домен с хорошей историей

Покупка истёкшего домена с историей это один из самых эффективных способов запустить новый проект с уже существующим ссылочным профилем, трастом и даже трафиком. Вместо того чтобы продвигать голый дом…

5 месяцев назад
Common Crawl как альтернативный источник данных для восстановления сайтов

Когда речь заходит о восстановлении сайтов из архивов, почти все думают только о Wayback Machine. Это понятно: archive.org на слуху, у него удобный интерфейс, триллион сохранённых страниц. Но Wayback …

5 месяцев назад