2026-09-17 · ← ニュース
インターネットの粛清は延期された。MicrosoftとOpenAIの弁護士は、外国のコンテンツなしのトレーニングは経済的なフィクションであると認めている
テック巨人は、パブリックドメインのデータと購入したアーカイブのみで最先端のAIをトレーニングできるというふりをするのをやめた。OpenAIとMicrosoftが英国貴族院に提出した文書は、データに対する現在のアプローチの現実的な擁護を明らかにしている。彼らは、Web全体のスクレイピングが物議を醸すことを認めているが、それなしでは技術的にも経済的にも不可能であると主張している。
404 Mediaの代表者は、この姿勢を盗みとして厳しく批判している。しかし、ビジネスの観点から見ると、これは明確な境界の設定である。OpenAIは、現在の著作権法がインターネット上で厳格に施行された場合、基盤モデルの存在を本質的に禁止することになると率直に述べている。したがって、フェアユースの法理は彼らにとって単なる便利な抜け穴ではなく、存続に不可欠なものである。
クリーンデータ神話の終わり
企業顧客や投資家にとって、この声明は重要なシグナルである。これは、誰かがライセンスされた「クリーン」なデータのみで同様に有能なモデルをまもなく構築するという神話の決定的な終わりを意味する。出版社との商業契約(OpenAIがAxel SpringerやAPと結んでいるようなもの)は、必要なトレーニング量の海の一滴にすぎない。
ウェブスクレイピングへの依存を公然と認めることは、著作権訴訟のリスクがビジネスモデルに恒久的に組み込まれていることを示している。AI企業は、技術的および地政学的な圧力が、特定の国でのイノベーションを停止するリスクを冒すよりも、開発に有利になるように規則を曲げることを裁判所や規制当局に強いることに賭けている。
誰がウェブのインフラストラクチャにお金を払うのか
本当の問題は、トレーニング自体ではなく、データを生成するエコシステムへの影響である。LLMがチャットで直接回答するため、コンテンツ作成者や小規模なWebサイトはトラフィックを失っている。作成者の経済モデルが崩壊した場合、モデルは将来の世代をトレーニングするための新しいデータのソースを失う(いわゆるモデルの崩壊)。
大手出版社は個別のライセンスを交渉するだろうが、インターネットのロングテールは補償されないままである。現在の状況は持続不可能である。AI企業は無料のインフラストラクチャとしてパブリックWebから価値を抽出しているが、自社の製品でこのインフラストラクチャを積極的に損なっている。
著作権の新しい定義
この対立は、避けられない規則の書き換えに向かっている。新しい法律によるものであろうと、前例となる裁判所の決定によるものであろうと、著作権の定義は、パターンを理解するために機械がテキストを読むことはもはや海賊版のコピーと同じように罰することはできないという事実に適応しなければならない。
トレーニングをオプトアウトするメカニズム
これを決定するのは、規制当局がオプトアウトメカニズムにどのようにアプローチするかである。変化の証拠は、作家による別の訴訟ではなく、Webサイトの所有者が自分のデータをトレーニングコーパスに含めるための価格を効果的に交渉できるようにするテクノロジーの広範な展開になるだろう。
Lilithの判定
購入したフェアトレードのコンテンツのみをモデルに供給するというおとぎ話は終わった。OpenAIは法廷で皆が知っていることを声に出して言った。私たちのビジネスはインターネット全体を無料で手に入れたからこそ機能しているのであり、それを禁止されれば私たちは終わりだ。
外部リンクは最後に置いています。まずここで簡潔に解説 — 他人のサイトを探し回る必要はありません。
元の記事 ↗ ↗