人工知能 (AI) の急速な進歩により、AI モデルをトレーニングするための大規模なデータセットとさまざまなソフトウェアの必要性が高まっています。このプロセスでは、開発者と研究者はオープンソースのライセンスを利用して、データを自由に使用し、モデルを開発し、研究結果を共有します。ただし、AI モデルのトレーニングに適したライセンスを選択する場合は、さまざまな法的および技術的要素を考慮することが重要です。オープンソースとは、作品を無条件に自由に使用できるという意味ではありません。使用条件と法的制約を明確に理解する必要があります。このコラムでは、AI トレーニングに適切なオープンソース ライセンスと、ライセンスを選択する際に考慮すべき重要な要素について詳しく説明します。
オープンソース ライセンスは、ユーザーがコードやデータを共有できるようにしながら著作権者の権利を保護するように設計されたソフトウェアやデータの使用、変更、配布を許可します。これらのライセンスは、コピーレフト ライセンスとパーミッシブ ライセンスの 2 種類に大別できます。どちらのタイプもソフトウェア使用の自由を提供しますが、その自由の範囲と条件には大きな違いがあります。これら 2 つのライセンスの主な機能と違いを詳しく見てみましょう。

コピーレフト ライセンスは、ソフトウェアの自由な使用を保証すると同時に、その自由を維持するための強力な規定を含みます。このライセンスに基づくソフトウェアは、ソース コードを他の開発者またはユーザーに提供する場合、同じライセンス条件を適用する必要があります。コピーレフト ライセンスは、ソフトウェアのオープン性と自由を強制します。
主な特長:
代表的なコピーレフトライセンス:
寛容なライセンスは、ソフトウェアの使用と配布に対する制限を最小限に抑えながら、ユーザーに最大限の自由を提供します。寛容なライセンスに基づくソフトウェアでは、元のライセンスに基づいて変更されたソフトウェアを配布する必要がなく、使用、変更、配布に関して非常に柔軟な条件が提供されます。
主な特長:
代表的な許可ライセンス:
AI トレーニング用のライセンスを選択する場合は、次の要素を考慮する必要があります。

AI トレーニングで頻繁に使用される主要なオープンソース ライセンスの一部を以下に示します。ただし、これらのライセンスに基づく著作物を AI トレーニングに使用することが著作権侵害に該当するかどうかは、裁判所によって判断されます。特に米国では、AI モデルによって生成されたコンテンツが元の著作権作品から十分に変換されていない場合、データ トレーニングは著作権侵害とみなされる可能性があります。
AIの開発が進むにつれ、生成AIモデルが注目を集めています。これらのモデルは、テキスト、画像、音楽などの生成に使用され、特に自然言語処理とコンピューター ビジョンにおいて重要な革新を達成しました。 AI のトレーニング プロセスでは大量のデータが使用され、多くの場合、このデータは著作権によって保護されています。トレーニング中に著作権帰属が表示されないのは、通常、トレーニング プロセスの閉鎖的な性質と、生成された出力が元の著作権で保護された作品に直接リンクされていないためです。たとえば、META の LLaMA のようなオープンソース AI モデルでさえ、トレーニングに使用されるデータセットを公開していません。
ただし、元の著作権で保護された作品が単に分析されただけであるか、トレーニングプロセス中にそこからパターンが学習され、最終的に生成された出力がオリジナルと直接類似していない場合は、著作権帰属の欠如は著作権侵害とはみなされない可能性があります。この議論は米国で議論されている議論であり、裁判所の判決によって解釈が変わる可能性がある。
対照的に、欧州は EU AI 法を通じて著作権の帰属に関して明確な立場をとっています。 AI モデル、特に生成 AI モデルは、開発に使用された著作権で保護されたコンテンツを開示する必要があります。これは、トレーニングで使用されるデータが著作権法に違反しないようにするためです。したがって、AI システム開発者は、トレーニング中に使用される著作権で保護されたコンテンツに関する詳細情報を文書化し、開示する必要があります。

2023 年 12 月 27 日、文化体育観光部と韓国著作権委員会は生成 AI 著作権に関するガイドラインを発表しました。これらのガイドラインは、AI ビジネス、著作権者、ユーザーを対象として、コンテンツを生成するために大規模なデータセットを使用することから生じる著作権紛争を防ぐことを目的としています。
AIビジネスの視点から:
著作権者の観点から:
AIユーザーの視点から:
これらのガイドラインにはまだ法的拘束力はありませんが、AI 業界は、これらのガイドラインが新しいビジネスの取り組みに負担をかける可能性があると懸念を表明しています。超AI推進協議会は、このガイドラインがAIの育成を制限する可能性があると見ており、著作権保護とAI開発のバランスをとる新たな法的枠組みを求めている。
AI テクノロジーの進歩に伴い、AI モデルのトレーニングには大規模なデータセットの使用が不可欠になりました。これらのデータセットはオープンソースとして提供されることが多く、開発者や研究者がそれらを使用して AI モデルをトレーニングできるようになります。ただし、AI モデルのトレーニングに著作権で保護されたマテリアルを使用することが著作権侵害に該当するかどうかは、依然として不明瞭な領域です。ただし、オープンソース ライセンスでは著作物の使用に伴う権利が明確に定義されており、そのライセンスに基づいて提供される素材は、条件に従う限り自由に使用できます。特に、寛容なライセンス (MIT、Apache 2.0 など) では、使用、変更、配布に対する制限がほとんどなく、AI モデルのトレーニングに使用するときに法的問題が発生する可能性が低くなります。
さらに、AI モデルのトレーニング中に著作権侵害が発生するかどうかを判断するには、学習したデータを単に参照するだけなのか、それを直接複製または再現するのかを区別する必要があります。 AI モデルは通常、著作権で保護された作品の内容や形式を複製するのではなく、データセットからパターンや統計的特徴を学習して新しい出力を生成することによって動作します。このプロセスは、著作権法に基づく「二次的著作物」の作成とは異なり、既存の著作物の直接の複製とはみなされません。
さらに、AI モデルによって生成されたコンテンツがオリジナルの作品と実質的に類似または複製していない場合、著作権法で定義される著作権侵害の範囲から外れる可能性があります。学習データに基づいて新たな出力が生成された場合でも、「実質的類似性」の基準を満たさない限り、著作権侵害とみなされる可能性は低くなります。これは特に米国の判例に当てはまります。そこでは、「アイデアと表現の二分法」原則により、アイデア自体は、その具体的な表現とは対照的に、著作権によって保護されないとされています。
ただし、これは個人的な見解であり、各管轄区におけるさらなる裁判所の判決を待って、慎重に解釈する必要があります。
AI 開発者と企業にとって、コピーレフト ライセンスと寛容ライセンスの違いを理解し、AI モデルの使用目的と配布計画に沿ったライセンスを選択することが重要です。 AI の開発と法的安全性の両方を確保するために最適なライセンスを選択するには、商用利用、データのオープン性、特許保護などのさまざまな要素を考慮することが重要です。 AIトレーニングにおける著作権の問題は複雑であり、各国の法基準やガイドラインを継続的に監視し、適切に対応することが重要です。