
Проект, который продвигается под слоганом «unlock hidden stories» («открой скрытые истории») изначально предназначался для ученых и журналистов, но c начала июня доступен для всех желающих.
Исследователям и репортерам дают преференции – их запросы обрабатываются быстрее, и хранилище больше. Для подтверждения статуса достаточно дать ссылку на СМИ или персональную страницу на сайте университета.
Если говорить кратко, то Pinpoint – это система для анализа больших массивов документов. И в этом ее ключевое отличие от другого популярного сервиса Google – Notebook LM, продукта, который нужен не столько для получения выводов, сколько для красивых визуализаций.
По аналогии с Notebook LM в Pinpoint можно создавать коллекции файлов – только объем их значительно больше. Если в «Блокноты» Notebook LM загружается до 50 файлов, то в «Коллекции» Pinpoint – до 200 тыс. документов. Общий объем доступного хранилища – до 100 гигабайт.
Ниже указаны доступные для обработки форматы (источник – мануал Google).
| Формат | Описание | Ограничения |
| Текст (TXT, RTF, CSV) | Анализ «голого» текста. | Максимальный размер файла – до 10 Мб. |
| Документы MS Office (DOC, XLS, PPT) | Анализ файлов, загруженных с компьютера | Максимальный размер файла – до 10 Мб. |
| Документы Google | Документы и презентации Google конвертируются в PDF-формат. | Максимальный размер файла – до 10 Мб. |
| Документы PDF | Распознает печатный и рукописный текст. | Максимальный размер файла – до 1 Гб. Файлы объемом свыше 500 Мб разделяются на несколько файлов для обработки. |
| Электронная почта (EML, MBOX) | Анализирует письма в специфических форматах или в виде PDF. | |
| Веб-страницы (PDF, HTML) | Страницы нужно скачать и загрузить в систему. | Не поддерживает URL-адреса, только страницы в виде файлов. |
| Изображения (JPG, PNG, GIF, BMP, TIFF) | Система распознает текст и сохраняет в формате PDF. | Максимальный размер изображения – до 10 Мб. |
| Аудиофайлы (MP3, WAV, FLAC, WMA и др.) и видеофайлы (MP4, MPEG, MOV, WMV, AVI и др.) | Преобразует в текстовые документы с возможностью поиска и скачивания. Транскрибация более чем на 100 языках. | Максимальный объем – до 2 часов при нормальной скорости воспроизведения и меньше 8 Гб. |
Объединив в коллекцию рукописи, аудиофайлы, PDF-документы, вы можете работать с получившейся базой – пользователю доступны опции «Обобщить», «Сравнить», «Классифицировать», «Извлечь данные». К примеру, для классификации вы можете выбрать до 100 документов и выделить до пяти критериев – система сама проведет необходимую работу.

Не сказать, что Pinpoint предложил что-то революционно новое: аналитики уже приноровились использовать чат-боты для анализа – пишут системные промпты, загружают файлы, обобщают их в проекты. Но Pinpoint упрощает процесс. В архитектуре сервиса прослеживается стратегия Google – отследить типичные паттерны поведения пользователей и предложить сервис, который позволяет их реализовать нажатием всего нескольких кнопок, не меняя даже вкладки браузера.
Американский исследователь журналистики Джереми Каплан отмечает, что Pinpoint прекрасно годится для расследований: анализ писем позволяет отслеживать связи, а поиск по базе дает возможность выделять нужные объекты интереса – людей, организации, локации. Также эксперт советует комбинировать Pinpoint с Notebook LM.
«Если у вас большая коллекция документов, подумайте о том, чтобы собрать, сохранить, упорядочить и транскрибировать их в Pinpoint. Затем перенесите самые важные файлы в NotebookLM для дальнейшего анализа и создания таких материалов, как отчеты, презентации, инфографика, карточки, аудио и видео», – пишет Каплан.
Когда вы загружаете в облачный сервис большие массивы документов, то вопрос конфиденциальности здесь – едва ли не самый важный. Вот, что пишет Google: «По умолчанию документы, загруженные в коллекции, доступны только вам. Мы не используем документы из частных коллекций для обучения больших языковых моделей».

Исключение составляют лишь те коллекции, чьи владельца сознательно сделали их общедоступными. Их можно найти в разделе «Обзор» (Explore). На данный момент насчитывается почти 220 коллекций. Несмотря на многообразие источников, абсолютное большинство – это подборки, принадлежащие СМИ из США и Латинской Америки. В основном коллекции содержат по 10-20 документов, но есть и крупные архивы размером от 500 до тысячи файлов – например, подборка юридических документов, связанных с тяжбой Илона Маска против компании OpenAI от новостного агентства Associated Press.
