Автор Тема: OpenAI рассказала как запретить чат-боту GPTBot доступ к сайтам  (Прочитано 3664 раз)

0 Пользователей и 2 Гостей просматривают эту тему.

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
X обновила свои правила для разработчиков, запретив использование контента платформы для обучения больших языковых моделей. В новой версии соглашения появился пункт, прямо запрещающий использовать X API или контент для дообучения или тренировки foundation или frontier моделей.

Интересно проследить эволюцию политики X: в 2023 году платформа изменила политику конфиденциальности, разрешив использовать публичные данные для обучения AI-моделей, а в октябре прошлого года даже позволила третьим сторонам тренировать свои модели. Собственно, ничего не изменилось — просто тогда xAI была "третьей стороной", а сейчас это одна компания.

У которой, кстати, в настройках пользователя галочка "Разрешить использовать мои публичные данные для обучения и файн-тюнинга" взведена по умолчанию.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста


Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: OpenAI рассказала как запретить чат-боту GPTBot доступ к сайтам
« Ответ #31 : 23, Октября 2025, Четверг, 18:00:21 pm »
Reddit подал иск против четырех компаний за незаконный скрапинг своих данных. Три из них — SerpApi из Техаса, литовская Oxylabs и российская AWMProxy — скрапят поисковую выдачу Google и продают данные AI-компаниям вроде OpenAI и Meta. Четвертая — это Perplexity.

Perplexity при этом получала официальное требование прекратить индексировать и удовлетворила его. Но цитирование Reddit в результатах Perplexity выросло в 40 раз. Выяснилось, что они просто стали покупать те же данные у посредников. Reddit устроил ловушку — создал тестовый пост, который мог проиндексировать только Google и который больше нигде не существовал. Через несколько часов этот контент всплыл в Perplexity.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста


Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: OpenAI рассказала как запретить чат-боту GPTBot доступ к сайтам
« Ответ #32 : 24, Октября 2025, Пятница, 10:13:10 am »
Cloudflare (интернет-инфраструктурная компания) и её CEO Matthew Prince выступили в Великобритании перед Competition and Markets Authority (CMA) с предложением обязать Google LLC разделить (unbundle) свои веб-краулеры: один для поисковой индексации, другой — для сбора данных, используемых в ИИ.

Великобритания сейчас — самый активный регулятор в Европе в вопросах ИИ и цифровой конкуренции.

Prince утверждает, что Google использует один и тот же краулер для поисковой индексации и для ИИ-сервисов, что даёт компании нечестное конкурентное преимущество.

Cloudflare предлагает, чтобы Google имел возможность разграничивать: поисковый краулер (для индексации) и ИИ-краулер (для обучения моделей), и чтобы издатели могли отдельно блокировать или разрешать доступ именно для ИИ-краулеров, не затрагивая поисковую индексацию.

То есть, если банить краулер Google, то лишаешься попадания в поисковую выдачу. Google стебётся, что они 32 года занимаются поиском и им такое можно.

Конфликт Google с большими медийщиками типа BBC привёл к тому, что в сети сейчас гонят на Gemini.

Ну а превращение краулинга в бизнес по продаже данных для обучения ИИ привёл к резкому увеличению назрузки и на форум. До 5000 краулеров одновременно создают нагрузку на форум и пока нет способа борьбы с ними, кроме платного сервиса Cloudflare.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: OpenAI рассказала как запретить чат-боту GPTBot доступ к сайтам
« Ответ #33 : 14, Февраля 2026, Суббота, 07:44:57 am »
Сэм Альтман и его OpenAI немного охуели, направив в комитет Палаты представителей по Китаю меморандум, в котором обвиняет DeepSeek в систематической дистилляции результатов американских моделей для обучения R1. Компания утверждает, что обнаружила «новые, обфусцированные методы» обхода защит — доступ через сторонние роутеры, программатический сбор выходных данных, сети нелегальных реселлеров.

То есть сначала OpenAI обучала свои модели на данных чужих сайтов, игнорируя запреты, а теперь зажали носик и обвиняют китайцев, которые, по сути, делают доступ пользователей к ИИ дешевле, чем монополисты из США. Эта благородная цель для китайцев привычна, они давно и успешно работают, как робингуды. Берут у богатых и делают это более доступным для бедных.

А дистилляция (knowledge distillation) — это способ «сжать» большую и умную модель ИИ в более маленькую и быструю, почти без потери качества. Если по простому, то есть большая модель-учитель — знает много, но тяжёлая и медленная. Тогда проворные китайцы создают маленькую модель-ученика — быстрее, дешевле, компактнее. Учитель показывает ученику не только правильные ответы, а как он думает (распределение вероятностей, нюансы).

Ученик учится копировать поведение учителя. Бинго!
#Приватбанк фашисты. В нём ненавидят людей старшего возраста

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Re: OpenAI рассказала как запретить чат-боту GPTBot доступ к сайтам
« Ответ #34 : 17, Мая 2026, Воскресенье, 22:25:39 pm »
Больше половины всего интернет-трафика впервые пришлось на ботов

Французская компания Thales опубликовала отчёт о состоянии интернет-трафика в 2025 году. Оказалось, боты впервые заняли больше половины всей активности в сети. Автоматизированные системы уже стали постоянной частью цифровой инфраструктуры.

Согласно отчёту, более 53% всего интернет-трафика теперь создают боты. При этом около 40% такого трафика относится к вредоносному. Особенно резко выросло число ИИ-атак — за год их количество увеличилось в 12,5 раза.

В Thales считают, что ИИ начал стирать грань между легитимной и вредоносной автоматизацией. Новые ИИ-агенты действуют как отдельная категория интернет-трафика наряду с «хорошими» и «плохими» ботами. Они напрямую взаимодействуют с API и приложениями.

Отдельной проблемой стали атаки на API и системы идентификации. Сейчас 27% бот-атак направлены именно на них. Финансовый сектор оказался одной из главных целей, на который пришлось 24% всех атак и 46% случаев захвата аккаунтов.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста

Оффлайн Сергей Горбачевский

  • Administrator
  • Знаменитый писатель
  • *****
  • Сообщений: 85993
  • Пол: Мужской
  • Есть вопросы? Пишите в личку
    • Награды
Cloudflare заменяет бинарную настройку для владельцев сайтов «блокировать AI-ботов» на управление тремя типами автоматического трафика — поисковая индексация, агенты и обучение моделей — для всех клиентов, включая бесплатный тариф. С 15 сентября 2026 года для новых доменов на страницах с рекламой обучение и агенты будут блокироваться по умолчанию, а поиск — разрешаться. Компания также запускает базу данных ботов BotBase для корпоративных клиентов и расширяет сигналы в robots.txt полем, задающим допустимый уровень использования контента.

С той же даты многоцелевые краулеры будут оцениваться по всем своим функциям сразу, например, Googlebot, Applebot и BingBot, собирающие данные одновременно для поиска и обучения, попадут под блокировку у всех, кто запретил обучение. По мнению сервиса, совмещение поиска и обучения в одном боте даёт действующим поисковикам нечестное преимущество — сайт не может отказать в обучении, не потеряв видимость в выдаче. Возможно, с самыми большими ботами будут действовать какие-то отдельные договоренности, но вот компаниям помельче фактически предъявляется ультиматум — или разделяйте ботов, или теряйте доступ к 20% доменов.
#Приватбанк фашисты. В нём ненавидят людей старшего возраста