Что можно восстановить из веб архива?

Опубликовано: 2020-12-29

Иногда наши пользователи спрашивают, почему сайт восстановился не полностью? Почему он не работает так, как хотелось бы? На это есть несколько ответов и самый первый из них, это то что сайт восстанавливается из Веб Архива, а следовательно можно восстановить только то что там есть и не более.

Веб Архив сохраняет только внешнюю часть сайта, и он не может сохранить внутреннюю структуру, админ панель, базу данных и так далее. Если сайт был раньше динамический, то после восстановления из архива он будет статический. Контактные формы, поля написания комментариев, покупка товаров в онлайн магазинах работать не будут. За некоторым исключением -  если все это реализовано на ява скриптах, которые были сохранены Веб Архивом. С ними надо быть осторожнее, ведь часто бывает так, что они передают или берут какие-либо данные со сторонних доменов, и если раньше там был к примеру скрипт счётчика посещений, то теперь, после того как домен был перекуплен там может быть все что угодно, в том числе и вирусы.

Мы рекомендуем после восстановления сайта проверить с помощью нашей CMS все внешние ссылки в коде ява скриптов по шаблону http:// и https:// и разобраться что они делают.

Другой пример, почему сайт работает не так, как надо - не скачанные стили CSS. На некоторых сайтах стили могут находиться на другом домене. При скачивании сайта с помощью нашей системы скрипт обрабатывает только ссылки с одного домена и не идёт далее по внешним ссылкам. Это можно легко проверить посмотрев в коде сайта адрес, где находятся стили сайта. И если они имеет подобный вид -   https://another_domain.com/styles/main.css  , то в этом случае лучше их скачать из Веб Архива и вручную поставить на сайт с помощью нашей CMS.

И наконец третий, и самый распространённый случай некорректной работы восстановленного сайта - неправильно заданный временные промежутки для восстановления. Дата архива сайта, которую вы видите в archive.org не означает что весь сайт, от начала до конца был архивирован именно тогда. На самом деле все файлы, стили, скрипты, картинки его были сохранены в разное время. Слишком узкий промежуток времени, заданный в нашей системе как правило приводи к тому что существенная часть cайта не восстанавливается.  Выбрать правильный таймстемп порой весма не просто, но в помощь вам у нас есть целая статья о том, как это делается - https://archivarix.com/ru/blog/3-how-does-it-works-archiveorg/

Использование материалов статьи разрешается только при условии размещения ссылки на источник: https://archivarix.com/ru/blog/what-can-be-recovered/

Бесплатные YouTube-инструменты на Tube Search: покадровый просмотр, теги, проверка имени канала и авторских прав

У Tube Search появился раздел бесплатных YouTube-инструментов. Это небольшие утилиты, которые решают конкретные повседневные задачи: рассмотреть видео покадрово, вытащить скрытые теги, проверить занят…

3 недели назад
Как скачать субтитры с YouTube, даже с удалённых видео

Вы нашли на YouTube нужное видео, но не хотите его смотреть целиком ради пары фраз. Или вам нужен текст лекции, чтобы перевести его, процитировать или просто прочитать по диагонали. Субтитры YouTube р…

1 месяц назад
Сколько живёт веб-страница: что говорят исследования о link rot

Откройте любую статью десятилетней давности и пройдитесь по ссылкам в ней. С большой вероятностью часть из них уже никуда не ведёт. Вместо нужной страницы вас встретит ошибка 404, припаркованный домен…

1 месяц назад
Archivarix Echo: проверьте 200+ веб-архивов одним запросом

Интернет постоянно осыпается. Страницы уходят в офлайн, аккаунты удаляют, статьи прячут за пейволл, проекты закрывают. Но копии чаще всего где-то остаются: Wayback Machine, archive.today, Common Crawl…

1 месяц назад
AI-саммари видео в Archivarix Tube Search

Когда вы находите удалённое видео YouTube через Tube Search, вы обычно получаете метаданные: название, описание, дату загрузки и иногда субтитры. Это уже полезно. Но чтение необработанных субтитров, ч…

4 месяца назад
Archivarix Tube Search - Поисковая система по удаленным видео YouTube

Tube Search - это поисковый движок по архивным данным YouTube. Сервис агрегирует информацию из нескольких публичных источников: Wayback Machine (Internet Archive), Common Crawl и различных собранных д…

4 месяца назад
Archivarix Broken Links Recovery: бесплатный плагин WordPress для поиска и восстановления битых ссылок

Со временем внешние ссылки в записях Wordpress неизбежно ломаются, страницы удаляются, домены истекают, видео становятся недоступными. Проверять сотни или тысячи ссылок вручную непрактично. Archivarix…

5 месяцев назад
Как Internet Archive решает, что архивировать: приоритеты, частота, источники данных

Триллион сохранённых страниц. Более 99 петабайт данных. Сотни краулов, работающих каждый день одновременно. За этими цифрами стоит вопрос, который задаёт себе каждый, кто профессионально работает с ве…

5 месяцев назад
Как найти и купить истёкший домен с хорошей историей

Покупка истёкшего домена с историей это один из самых эффективных способов запустить новый проект с уже существующим ссылочным профилем, трастом и даже трафиком. Вместо того чтобы продвигать голый дом…

5 месяцев назад
Common Crawl как альтернативный источник данных для восстановления сайтов

Когда речь заходит о восстановлении сайтов из архивов, почти все думают только о Wayback Machine. Это понятно: archive.org на слуху, у него удобный интерфейс, триллион сохранённых страниц. Но Wayback …

5 месяцев назад