Перейти к содержимому

Reddit закрыл RSS и публичный API: что делать с парсингом данных прямо сейчас

Марина Погодина

6минут чтения

Снимок страницы TechCrunch: первый экран с заголовком Reddit is killing RSS feeds and ending public API access because of AI bots
Первоисточник · techcrunch.comReddit is killing RSS feeds and ending public API access because of AI botsОткрыть первоисточник в новой вкладке
Надпись: «Адам Ньюмен. Reddit API Pause».

В понедельник утром аналитик присылает вам отчёт по упоминаниям бренда, и в нём ноль строк за выходные. Скрипт работает, ошибки в логах пустые, но данных нет. Так обычно и узнают, что источник закрылся: плата рассылает письмо о прекращении доступа и закрывает канал.

Reddit объявил, что прекращает поддержку RSS-лент и закрывает публичный доступ к API, и назвал причиной ИИ-ботов, которые выкачивали контент платформы в промышленных масштабах. Об этом пишет TechCrunch. Если вы хоть раз тянули с Reddit упоминания своей компании, отзывы о продукте или ветки для аналитики, этот сигнал адресован лично вам.

Снимок страницы TechCrunch: первый экран с заголовком Reddit is killing RSS feeds and ending public API access because of AI bots
Источник: TechCrunch

Что именно закрыли и почему

Механика решения простая, если разложить её по звеньям. Публичный API и RSS были созданы в эпоху, когда данными платформы пользовались читатели, отдельные разработчики и сервисы агрегаторов.

Как закрытие ударит по вашей аналитике: RSS-ленты исчезают, Публичный API закрывается, Скрипты отдают пустые ответы, Данные остаются в платном контуре. Иллюстрация к разделу Что именно закрыли и почему, вид: схема процесса
Иллюстрация: RSS и публичный API перестают работать, старые скрипты молча возвращают пустоту

Потом появились ИИ-компании, которым нужен корпус человеческих разговоров для обучения моделей, и бесплатный канал превратился в трубу, из которой качают без меры.

Платформа отвечает так, как отвечает любой владелец актива: закрывает бесплатную трубу и оставляет платный контур с договором, лимитами и контролем, кто и зачем берёт данные. Это закономерный ход, и я бы не ждала, что Reddit станет последней площадкой с таким решением.

Схема-цепочка из пяти звеньев: публичный API и RSS открывают данные, ИИ-боты качают контент в промышленных масштабах, нагрузка и потеря контроля растут, платформа закрывает бесплатные каналы, данные остаются только в платном контуре.
Замкнутый круг: бесплатный доступ привлекал ботов, боты вынудили закрыть доступ, а платный канал стал единственным способом забирать данные легально.

Для вас это значит одно: любой сбор данных с Reddit, который построен на публичных каналах, теперь работает на честном слове и сломается в любой день. Причём сломается тихо.

Почему поломку вы заметите не сразу

Самое коварное в закрытии API то, что скрипт редко падает с ошибкой. Чаще он продолжает крутиться по расписанию, получать пустые или урезанные ответы и складывать их в базу как валидные данные. Деградацию вы увидите через недели, когда однажды сравните динамику с прошлым кварталом и обнаружите обрыв.

Я семнадцать лет смотрю на такие вещи глазами аудитора, и в этом опыле есть одна привычка, которую советую перенять: любой источник данных без владельца и безSLA внутри компании это уже инцидент, просто ещё не обнаруженный. RSS-лента конкурента, публичный API форума, страница, которую вы парсите кроном, всё это одна категория риска.

Закрытие Reddit показало эту категорию всем, у кого она была закрыта от глаз. У одних источником были именно его ленты, у других что-то ещё, но принцип один: бесплатный открытый канал живёт до первого крупного бота, который его исчерпает.

Куда переносить сбор данных

Выбор канала зависит от задачи, и здесь я советую разложить свои потребности по трём веткам: разовая аналитика, постоянный мониторинг, корпус для обучения моделей. У каждой задачи свой разумный путь, и цена ошибки разная.

Для обучения моделей потребуется отдельная коммерческая лицензия на данные, и это разговор уже не про скрипты, а про юристов.

Порядок действий: инвентаризация источников, аудит кода на старые вызовы API, выбор официального канала доступа, перенос скриптов, проверка на тестовых данных, постановка на мониторинг.
Порядок из шести шагов: от инвентаризации того, что вы реально тянете, до мониторинга упоминаний о бренде через легальный канал.

Технически перенос сборов я всегда делаю кодом на Python или TypeScript: скрипт, конфиг с источниками, логирование каждого ответа и алерт, когда данных пришло меньше ожидаемого. Именно алерт на аномально пустой ответ спасает от тихой деградации, о которой я писала выше.

Чек-лист переноса до последнего дня работы старых каналов

Ниже чек-лист, который можно прогнать по своим системам на этой неделе. Каждый пункт проверяемый, и если на каком-то вы застряли, это и есть ваше узкое место.

Проверить на этой неделе: Найти все вызовы RSS и API, Зафиксировать, что собираете, Выбрать официальный канал, Переписать сбор на Python, Сверить данные до и после. Иллюстрация к разделу Чек-лист переноса до последнего дня работы старых каналов, вид: чек-лист
Иллюстрация: Пустой ответ от скрипта вы заметите не сразу, а по провалу отчёта
  1. Найти в кодовой базе все обращения к RSS-лентам и публичному API Reddit: поиск по репозиториям по домену платформы и по словам rss и feed.
  2. Зафиксировать в таблице, какие именно данные вы собираете: упоминания бренда, отзывы, ветки по темам, и кто внутри компании их потребляет.
  3. Определить для каждого потока задачу из трёх веток: разовая аналитика, постоянный мониторинг, обучение модели.
  4. Выбрать официальный канал доступа и запросить условия: лимиты, состав данных, цена, порядок согласования.
  5. Переписать сбор на Python или TypeScript с конфигом источников и логированием каждого ответа.
  6. Настроить алерт на аномально пустой ответ: пришло меньше данных, чем в среднем за прошлые периоды, значит сигнал в дежурный канал.
  7. Сверить данные за перекрывающийся период: объём, состав полей, полноту веток до и после переноса.
  8. Назначить владельца каждого потока данных: имя человека, иначе контроль умрёт вместе с проектом.
Схема-развилка: если данные нужны разово, смотрите в сторону официальных выгрузок и отчётов; если нужен постоянный мониторинг упоминаний, выбирайте договорной доступ; если данные для обучения моделей, потребуется отдельная коммерческая лицензия.
Ответ зависит от того, зачем вам данные: разовая аналитика, постоянный мониторинг или обучение модели. Для каждой задачи своя ветка решения.

Последний пункт списка часто кажется бюрократией, пока не наступает день, когда источник меняет правила, и выясняется, что спросить не у кого. Владелец потока это тот, кто получит алерт и примет решение, чинить или закрывать.

Что почитать рядом

Тема закрытых данных шире одного Reddit. TechCrunch в тот же день опубликовал материал о том, что экономика потребительских ИИ-продуктов складывается тяжело, и эта статья хорошо объясняет, почему платформы так яростно защищают свои корпуса данных: именно они остаются активом, когда всё остальное в цепочке дешевеет.

Снимок страницы TechCrunch: первый экран с заголовком The ugly economics of consumer AI
Источник: TechCrunch

Если вы собираете упоминания о бренде в нескольких каналах и хотите поставить этот процесс на рельсы, у PROMAREN есть готовая практика по ИИ-ассистентам и сбору данных, включая перенос источников на официальные API и настройку мониторинга, который сообщит о проблеме раньше, чем её увидит отчёт.

Вопросы, которые мне задают про закрытие API

Почему Reddit закрыл RSS и публичный API?

Платформа назвала причиной ИИ-ботов, которые массово выкачивали контент через открытые каналы. Бесплатный доступ превратился в трубу для сбора обучающих данных, и владелец актива закрыл её, оставив только официальные договорные каналы.

Мои скрипты перестанут работать в один день?

Скорее скрипты продолжат работать и начнут молча возвращать пустые или урезанные ответы, и это опаснее падения. Именно поэтому в чек-листе выше стоят логирование каждого ответа и алерт на аномально пустой выгруз, без них деградацию вы увидите по провалу в отчёте через недели.

Можно ли остаться на самодельном парсинге страниц?

Технически иногда можно, и на коротком горизонте это даже сработает, но решение хрупкое: платформа меняет вёрстку и правила без предупреждения, а обход официальных каналов создаёт юридический риск для компании. Я бы рассматривала такой вариант только как временный костыль с датой демонтажа в календаре.

Стоит ли ждать того же от других площадок?

Логика решения не специфична для Reddit: любой владелец корпуса человеческих текстов, на котором тренируют модели, получает стимул закрыть бесплатный доступ. Планируйте сбор данных так, чтобы смена правил одной платформы не роняла всю вашу аналитику.

Что проверить сегодня же

Запустите поиск по своим репозиториям по адресу платформы и по слову rss. Если нашли хотя бы одно обращение, у вас есть поток данных без SLA, и теперь вы знаете, как это чинить: инвентаризация, официальный канал, перенос на код, алерт, владелец.

У вас есть скрипты, которые тянут данные с площадок, давно не проверявшихся на предмет правил? Напишите, какие источники стоят у вас на кроне, и я разберу в следующем материале, как выстроить мониторинг так, чтобы тихая поломка становилась шумным алертом.

Новые разборы выходят в моём канале: t.me/promaren.

AI-ассистенты: экономия 4 часа в день

RAG-помощник на ваших данных и регламентах

Чем подкреплено

Первоисточники

Вопросы

Частые вопросы

Почему Reddit закрыл RSS и публичный API?

Платформа прекращает поддержку RSS-лент и публичного доступа к API из-за ИИ-ботов, которые массово выкачивали контент. Для владельцев бизнес-аккаунтов и коммерческих проектов данные остаются доступными только через официальные договорные каналы.

Что делать, если мой скрипт собирает данные с Reddit через публичный API?

Проводите инвентаризацию: найдите все места в коде, где идут вызовы старых каналов, зафиксируйте, какие именно данные вы собираете, и выберите официальный канал доступа. После переноса обязательно сверьте объём и состав данных до и после.

Как следить за упоминаниями бренда после закрытия RSS?

Через официальные договорные каналы доступа: мониторинг упоминаний переводится на согласованный API, а сбор реализуется кодом на Python или TypeScript. Разовые задачи можно закрывать официальными выгрузками и отчётами.

Чем опасен самодельный парсинг после закрытия API?

Он ломается молча: скрипт продолжает работать, но возвращает пустые или неполные данные, и деградацию вы заметите только по провалу в отчётах. Кроме того, обход официальных каналов создаёт юридический риск для компании.

Кто делает
Марина Погодина, основатель PROMAREN

Марина Погодина, основатель PROMAREN

17 лет в ИТ и управлении технологическими рисками, из них 14 лет в аудите ИТ и внутреннем контроле. Более 60 аудитов ИТ и информационной безопасности.

Об автореКанал в MAX (откроется в новой вкладке)

Похожие материалы

Надпись: «Нейросети. Не читайте всё подряд».
Нейросети для работы и бизнеса: промпты, документы, таблицы

Как читать новости нейросетей и не тонуть в шуме: пять фильтров и чек-лист

Разбираю пять фильтров, которые помогу вам отделять важные новости о нейросетях от шума. В конце дам чек-лист для быстрой проверки.

Читать
Обложка статьи: Как сказать клиенту, что с ним говорит бот: скрипт раскрытия и тест конверсии
Нейросети для работы и бизнеса: промпты, документы, таблицы

Как сказать клиенту, что с ним говорит бот: скрипт раскрытия и тест конверсии

Показываю, какой первой фразой голосовому ИИ-агенту признаться клиенту, что он бот, и как на своих звонках проверить, сколько это стоит конверсии.

Читать
A smartphone held flat like a butler's polished silver serving tray, carrying a tall, neatly balanced stack of miniature paper calendars, sealed envelopes and f
Нейросети для работы и бизнеса: промпты, документы, таблицы

Как отдать рутину голосовому агенту в телефоне: чек-лист из 10 пунктов

Показываю, какие повторяющиеся дела уже можно поручить голосом мобильному ChatGPT, где он ошибается и что проверить до первого поручения.

Читать