Количество слов, символов и страниц нужно авторам, редакторам, студентам, переводчикам и специалистам по документообороту. Эти показатели кажутся однозначными, но разные программы могут считать их по-разному: включать или исключать колонтитулы, сноски, скрытый текст, подписи к рисункам и содержимое таблиц.
Быстро посмотреть доступную статистику можно через инструмент проверки документов. Он анализирует поддерживаемый файл и показывает показатели, которые удаётся достоверно извлечь из его структуры.
Какая статистика бывает в документе
- число страниц или слайдов;
- количество слов;
- символы с пробелами и без пробелов;
- абзацы, строки, таблицы или листы;
- размер файла и число встроенных объектов;
- время редактирования, если редактор сохранил такое свойство.
Не каждый формат хранит готовые счётчики. Иногда результат вычисляется из текста, а иногда берётся из внутренних свойств. Поэтому доступный набор зависит от файла.
Как посмотреть количество слов и страниц
- Сохраните актуальную версию документа.
- Откройте Document Inspector Helionix.
- Выберите PDF, DOCX, TXT, HTML, RTF, XLSX, PPTX или ODT.
- После анализа найдите блок статистики или основных характеристик.
- Сравните данные с показателями штатного редактора, если число критично.
- Зафиксируйте, какая версия файла и какое правило подсчёта использовались.
Почему Word и другой сервис показывают разные числа
Редакторы по-разному трактуют слова с дефисом, числа, URL, формулы и текстовые рамки. Одни включают сноски и концевые сноски только по отдельной настройке, другие считают весь извлечённый текст. Скрытый текст и удалённые фрагменты в режиме исправлений также могут менять итог.
Как считается число страниц
В PDF страничная структура зафиксирована, поэтому число страниц обычно стабильно. В DOCX страницы формируются при верстке и зависят от шрифтов, полей, размера бумаги, принтера и версии редактора. Один и тот же DOCX на двух устройствах иногда получает разное количество страниц, хотя текст не изменился.
Особенности разных форматов
| Формат | Как интерпретировать статистику |
|---|---|
| Страницы фиксированы; слова зависят от наличия текстового слоя и качества распознавания. | |
| DOCX/ODT/RTF | Слова извлекаются из текста, страницы зависят от верстки и редактора. |
| TXT | Нет страниц как элемента формата; доступны символы, строки и слова. |
| HTML | Видимый текст нужно отделять от кода, метаданных и скрытых элементов. |
| XLSX | Важнее листы, заполненные ячейки и текстовые значения, чем «слова» и страницы. |
| PPTX | Основная единица — слайд; отдельно могут существовать заметки и скрытые слайды. |
Сканированный PDF и текстовый слой
Если страницы представляют собой изображения, анализатор может не найти слова вообще. Для подсчёта потребуется OCR — распознавание текста. Даже после OCR результат нужно проверить: колонки, таблицы, переносы и плохое качество скана приводят к ошибкам.
Как получить воспроизводимый результат
- считайте только финальную сохранённую версию;
- укажите, включены ли сноски, комментарии и скрытый текст;
- для лимита символов уточните, учитывать ли пробелы;
- для печати фиксируйте формат страницы и версию PDF;
- при споре используйте один согласованный редактор и метод.
Можно ли по статистике проверить полноту файла
Резкое уменьшение страниц или слов действительно может указывать на неправильный экспорт, но само по себе ничего не доказывает. Сравнивайте статистику с предыдущей версией и визуально просматривайте начало, середину и конец документа.
Частые вопросы
Считаются ли комментарии?
Это зависит от формата и метода. Если точность важна, удалите комментарии из копии либо договоритесь, что они не входят в объём.
Можно ли посчитать слова в PDF?
Да, если PDF содержит извлекаемый текст. Для скана сначала понадобится распознавание.
Итог
Статистика документа полезна только вместе с понятным правилом подсчёта. Посмотрите доступные показатели в Inspector, учитывайте особенности формата и сверяйте критичные значения в основном редакторе.
