Сканированный PDF часто весит значительно больше документа, созданного из текста. Причина проста: каждая страница хранится как изображение. Если сканер записал полноцветные листы с высоким разрешением, даже обычный договор на десять страниц может занимать десятки мегабайт.
Сжатие PDF в Helionix помогает уменьшить такую копию прямо в браузере. Скан при этом требует более внимательной проверки, чем цифровой PDF: буквы, подписи и печати являются пикселями и могут потерять чёткость вместе с изображением.
Почему скан получается тяжёлым
- высокое разрешение значительно превышает потребность чтения;
- цветной режим сохраняет информацию для каждого пикселя;
- серый фон бумаги, тени и шум плохо упаковываются;
- страницы содержат фотографии или сложную фактуру;
- сканер использует слабое или отсутствующее сжатие;
- в файл попали пустые обороты и повторные захваты.
С чего начать
Откройте исходник и определите, что обязательно сохранить. Для заявления это могут быть ФИО, номера, подпись и печать; для конспекта — карандашные пометки; для чека — мелкие суммы и QR-код. Контрольные зоны понадобятся после оптимизации.
Проверьте порядок и ориентацию листов. Пустые страницы, дубли и ошибочные захваты лучше удалить до сжатия через редактор страниц PDF. Так итоговый документ будет одновременно меньше и аккуратнее.
Как сжать сканированный PDF
- Сохраните оригинальный скан отдельно.
- Уберите только доказанные пустые или повторные страницы.
- Откройте компрессор PDF.
- Выберите документ и запустите бережную оптимизацию.
- Скачайте результат под новым именем.
- Сравните размер и откройте контрольные страницы.
- Увеличьте мелкий текст, печати, подписи и коды.
- При необходимости создайте более сильный вариант заново из оригинала.
Цвет, оттенки серого и чёрно-белый режим
Цвет необходим, если оттенки несут информацию: цветные печати, маркеры, фотографии, медицинские изображения или пометки. Для простого чёрного текста на белой бумаге цвет может быть избыточным. Оттенки серого сохраняют плавные переходы, а строго чёрно-белый вариант даёт маленький размер, но способен уничтожить слабые линии и серые подписи.
Если компрессор не предлагает выбор цветности, не нужно заранее ухудшать оригинал без необходимости. Сначала посмотрите результат стандартной обработки.
Разрешение и читаемость
Чем выше исходное разрешение, тем больше пикселей хранится на странице. Для чтения с экрана обычно не требуется тот же запас, что для печати мелкой графики. Однако универсального DPI нет: качество зависит от размера шрифта, контраста, состояния бумаги и назначения файла.
Вместо слепой ориентации на цифру откройте сложный фрагмент в реальном масштабе. Если цифры различимы, тонкие элементы не слились, а печать узнаваема, оптимизация может считаться приемлемой для этой задачи.
Шум и фон бумаги
Серые поля, пятна, тени от переплёта и цифровой шум создают множество мелких различий между соседними пикселями. Такие данные увеличивают файл. Лучший результат часто начинается ещё при сканировании: ровное освещение, чистое стекло, правильная экспозиция и плотное прилегание листа помогают получить и более красивый, и более компактный документ.
OCR и сжатие
OCR добавляет текстовый слой, благодаря которому можно искать и копировать слова. Само распознавание не обязательно делает PDF меньше. Если поисковый слой уже есть, после оптимизации проверьте, сохранилась ли возможность поиска и совпадает ли выделяемый текст с изображением страницы.
Когда лучше пересканировать
Если файл многократно превышает лимит, а сильное сжатие делает буквы нечитаемыми, качественнее пересканировать оригиналы с разумными параметрами. Это особенно полезно, когда исходные страницы были сняты в чрезмерном разрешении, с огромными полями или в цвете без необходимости.
Особые зоны проверки
- серии и номера документов;
- тонкие подписи синей или чёрной ручкой;
- круглые печати и штампы;
- QR- и штрихкоды;
- мелкие сноски и таблицы;
- слабый текст на обратной стороне;
- фотографии и диаграммы;
- карандашные пометки.
Частые вопросы
Почему один скан сжимается лучше другого?
На результат влияют цвет, шум, разрешение, сложность изображений и то, применялось ли сжатие раньше.
Можно ли сохранить OCR?
Это зависит от способа оптимизации. После обработки обязательно протестируйте поиск и копирование текста.
Нужно ли удалять пустые обороты?
Только если они не обеспечивают правильный разворот, нумерацию или юридическую полноту документа.
Почему печать стала плохо читаться?
Печать могла иметь низкий контраст, а сильная обработка уменьшила различия между её пикселями и фоном.
Итог
Сканированный PDF хорошо поддаётся оптимизации, но именно в нём качество сильнее всего зависит от изображений. Удалите очевидный мусор, начинайте с бережного режима и проверяйте мелкие юридически или практически важные детали.
