AI学習用のオープンソースライセンス

Pine IP Firm
2024年8月12日

人工知能 (AI) の急速な進歩により、AI モデルをトレーニングするための大規模なデータセットとさまざまなソフトウェアの必要性が高まっています。このプロセスでは、開発者と研究者はオープンソースのライセンスを利用して、データを自由に使用し、モデルを開発し、研究結果を共有します。ただし、AI モデルのトレーニングに適したライセンスを選択する場合は、さまざまな法的および技術的要素を考慮することが重要です。オープンソースとは、作品を無条件に自由に使用できるという意味ではありません。使用条件と法的制約を明確に理解する必要があります。このコラムでは、AI トレーニングに適切なオープンソース ライセンスと、ライセンスを選択する際に考慮すべき重要な要素について詳しく説明します。

オープンソース ライセンスの基本的な理解

オープンソース ライセンスは、ユーザーがコードやデータを共有できるようにしながら著作権者の権利を保護するように設計されたソフトウェアやデータの使用、変更、配布を許可します。これらのライセンスは、コピーレフト ライセンスとパーミッシブ ライセンスの 2 種類に大別できます。どちらのタイプもソフトウェア使用の自由を提供しますが、その自由の範囲と条件には大きな違いがあります。これら 2 つのライセンスの主な機能と違いを詳しく見てみましょう。

AI学習用のオープンソースライセンス

コピーレフトライセンス

コピーレフト ライセンスは、ソフトウェアの自由な使用を保証すると同時に、その自由を維持するための強力な規定を含みます。このライセンスに基づくソフトウェアは、ソース コードを他の開発者またはユーザーに提供する場合、同じライセンス条件を適用する必要があります。コピーレフト ライセンスは、ソフトウェアのオープン性と自由を強制します。

主な特長:

  • 自由の保証: コピーレフト ライセンスにより、改変、再配布、商用利用を含め、誰でもソフトウェアを自由に使用できることが保証されます。
  • 同一のライセンスを適用する義務: ソフトウェアまたはその派生物の修正バージョンは、オリジナルと同じライセンスに基づいて配布する必要があります。たとえば、GNU General Public License (GPL) に基づくソフトウェアは、変更または拡張後も GPL に準拠し続ける必要があります。
  • 必須の共有: ソフトウェアを修正または再配布する場合は、元のソース コードと修正されたソース コードの両方を公開し、ソフトウェアの開発と共有を促進する必要があります。

代表的なコピーレフトライセンス:

  • GNU 一般公衆利用許諾書 (GPL): コピーレフト ライセンスの代表者であり、ソフトウェアの自由な使用と共有を保証し、その自由の維持を強制します。
  • GNU 劣等一般公衆利用許諾契約書 (LGPL): GPL の変種で、主にライブラリに使用されます。ライブラリを使用するソフトウェアは必ずしも GPL に基づいて配布する必要はありません。

寛容なライセンス

寛容なライセンスは、ソフトウェアの使用と配布に対する制限を最小限に抑えながら、ユーザーに最大限の自由を提供します。寛容なライセンスに基づくソフトウェアでは、元のライセンスに基づいて変更されたソフトウェアを配布する必要がなく、使用、変更、配布に関して非常に柔軟な条件が提供されます。

主な特長:

  • 広い自由: 寛容なライセンスでは、変更やクローズド ソース ソフトウェアへの統合など、ほぼあらゆる方法でソフトウェアを使用できます。
  • 同じライセンスを適用する義務はない: ユーザーは、同じ寛容なライセンスに基づいて変更されたソフトウェアを配布する必要はありません。たとえば、MIT ライセンスに基づいてソフトウェアを変更し、クローズド ソース ライセンスに基づいて再配布することができます。
  • 簡単な要件: 寛容なライセンスでは、主に著作権表示と免責事項の保持が必要です。ユーザーは元の著作権所有者の名前とライセンス情報を保持する必要がありますが、その他の制限はほとんどありません。

代表的な許可ライセンス:

  • MITライセンス: 最も広く使用されている寛容なライセンスの 1 つで、ソフトウェアの使用、変更、配布に最小限の制限を提供します。
  • Apache ライセンス 2.0: 特許条項を伴う寛容なライセンス。使用の自由を確保しながら強化された法的保護を提供します。
  • BSDライセンス: 非常に簡単な条件で、自由に使用および配布できる寛容なライセンス。

ライセンスを選択する際の考慮事項

AI トレーニング用のライセンスを選択する場合は、次の要素を考慮する必要があります。

  • 開放性: ライセンスの選択は、AI モデルやデータを一般に公開するつもりか、非公開のままにするつもりかによって異なります。コピーレフト ライセンス (GPL など) ではソースを公開する義務が課せられますが、寛容なライセンス (MIT、Apache 2.0 など) ではより柔軟性が高くなります。
  • 商用利用: AI モデルを商業的に使用する予定がある場合は、寛容なライセンスの方が適しています。コピーレフトライセンスではソースコードの開示が要求されることが多く、商業秘密の維持が困難になります。
  • 特許保護: 特許関連の保護が必要な場合は、特許条項を含む Apache License 2.0 などのライセンスを検討してください。
  • データセットの使用法: データセットのライセンスは AI トレーニングに直接影響します。 CC-BY、CC0、PDDL などのデータセット固有のライセンスは、データを自由に使用および共有するのに有利です。

AI トレーニングでよく使用されるオープンソース ライセンス

AI学習用のオープンソースライセンス

AI トレーニングで頻繁に使用される主要なオープンソース ライセンスの一部を以下に示します。ただし、これらのライセンスに基づく著作物を AI トレーニングに使用することが著作権侵害に該当するかどうかは、裁判所によって判断されます。特に米国では、AI モデルによって生成されたコンテンツが元の著作権作品から十分に変換されていない場合、データ トレーニングは著作権侵害とみなされる可能性があります。

  • MITライセンス: ソフトウェアのコピー、変更、配布を含むほぼすべての権利をユーザーに付与する、広く使用されている寛容なライセンス。オリジナルの著作権と免責事項は保持する必要がありますが、商用利用は自由に許可されています。 MIT ライセンスは、制限が最小限に抑えられているため、AI モデルのトレーニングに適しています。
  • Apache ライセンス 2.0: 法的保護を強化する、特許条項を含む寛容なライセンス。特許保護が必要な場合やモデルを商業目的で使用する場合の AI モデル開発に適しています。
  • クリエイティブ・コモンズの帰属 (CC-BY): 主にデータセットに使用され、作成者を明示することを条件にデータを自由に使用できます。商用利用は許可されており、再配布には帰属のみが必要です。
  • クリエイティブ・コモンズ・ゼロ (CC0): クリエイティブ コモンズ ライセンスの最もオープンな形式で、パブリック ドメインに似ており、データとコードを無制限に使用できます。
  • Microsoft オープンデータ使用契約 (MS O-UDA): Microsoft が作成したライセンスで、AI トレーニングなどの特定の目的でのデータの自由な使用を許可しますが、一定の制限への準拠が必要です。
  • コミュニティ データ ライセンス契約 – 許容的 (CDLA-許容的): 帰属を条件として、データの自由な使用を許可します。商用利用を含むさまざまな目的でのデータの使用を明示的に許可するため、AI のトレーニングに有利です。

AIトレーニングにおける著作権帰属の問題

AIの開発が進むにつれ、生成AIモデルが注目を集めています。これらのモデルは、テキスト、画像、音楽などの生成に使用され、特に自然言語処理とコンピューター ビジョンにおいて重要な革新を達成しました。 AI のトレーニング プロセスでは大量のデータが使用され、多くの場合、このデータは著作権によって保護されています。トレーニング中に著作権帰属が表示されないのは、通常、トレーニング プロセスの閉鎖的な性質と、生成された出力が元の著作権で保護された作品に直接リンクされていないためです。たとえば、META の LLaMA のようなオープンソース AI モデルでさえ、トレーニングに使用されるデータセットを公開していません。

ただし、元の著作権で保護された作品が単に分析されただけであるか、トレーニングプロセス中にそこからパターンが学習され、最終的に生成された出力がオリジナルと直接類似していない場合は、著作権帰属の欠如は著作権侵害とはみなされない可能性があります。この議論は米国で議論されている議論であり、裁判所の判決によって解釈が変わる可能性がある。

対照的に、欧州は EU AI 法を通じて著作権の帰属に関して明確な立場をとっています。 AI モデル、特に生成 AI モデルは、開発に使用された著作権で保護されたコンテンツを開示する必要があります。これは、トレーニングで使用されるデータが著作権法に違反しないようにするためです。したがって、AI システム開発者は、トレーニング中に使用される著作権で保護されたコンテンツに関する詳細情報を文書化し、開示する必要があります。

韓国におけるAIと著作権法

AI学習用のオープンソースライセンス

2023 年 12 月 27 日、文化体育観光部と韓国著作権委員会は生成 AI 著作権に関するガイドラインを発表しました。これらのガイドラインは、AI ビジネス、著作権者、ユーザーを対象として、コンテンツを生成するために大規模なデータセットを使用することから生じる著作権紛争を防ぐことを目的としています。

AIビジネスの視点から:

  • AI モデルのトレーニング中に著作物を使用する場合は、明確な使用許可またはフェアユースの遵守を取得する必要があります。
  • AI によって生成された出力が既存の作品と類似することを防ぐためにフィルタリング措置が推奨され、責任を明確にするためにサービスプロバイダー間の明確な契約が推奨されます。

著作権者の観点から:

  • 著作権者が自分の作品が AI トレーニングに使用されることを望まない場合は、サービス条件でこれを指定するか、robots.txt 標準のような措置を講じてブロックすることができます。

AIユーザーの視点から:

  • AI によって生成された出力が既存の作品と類似している場合、公演、展示、または配布中に著作権侵害の問題が発生する可能性があるため、ユーザーは注意する必要があります。出典も必要です。

これらのガイドラインにはまだ法的拘束力はありませんが、AI 業界は、これらのガイドラインが新しいビジネスの取り組みに負担をかける可能性があると懸念を表明しています。超AI推進協議会は、このガイドラインがAIの育成を制限する可能性があると見ており、著作権保護とAI開発のバランスをとる新たな法的枠組みを求めている。

個人的な見解と結論

AI テクノロジーの進歩に伴い、AI モデルのトレーニングには大規模なデータセットの使用が不可欠になりました。これらのデータセットはオープンソースとして提供されることが多く、開発者や研究者がそれらを使用して AI モデルをトレーニングできるようになります。ただし、AI モデルのトレーニングに著作権で保護されたマテリアルを使用することが著作権侵害に該当するかどうかは、依然として不明瞭な領域です。ただし、オープンソース ライセンスでは著作物の使用に伴う権利が明確に定義されており、そのライセンスに基づいて提供される素材は、条件に従う限り自由に使用できます。特に、寛容なライセンス (MIT、Apache 2.0 など) では、使用、変更、配布に対する制限がほとんどなく、AI モデルのトレーニングに使用するときに法的問題が発生する可能性が低くなります。

さらに、AI モデルのトレーニング中に著作権侵害が発生するかどうかを判断するには、学習したデータを単に参照するだけなのか、それを直接複製または再現するのかを区別する必要があります。 AI モデルは通常、著作権で保護された作品の内容や形式を複製するのではなく、データセットからパターンや統計的特徴を学習して新しい出力を生成することによって動作します。このプロセスは、著作権法に基づく「二次的著作物」の作成とは異なり、既存の著作物の直接の複製とはみなされません。

さらに、AI モデルによって生成されたコンテンツがオリジナルの作品と実質的に類似または複製していない場合、著作権法で定義される著作権侵害の範囲から外れる可能性があります。学習データに基づいて新たな出力が生成された場合でも、「実質的類似性」の基準を満たさない限り、著作権侵害とみなされる可能性は低くなります。これは特に米国の判例に当てはまります。そこでは、「アイデアと表現の二分法」原則により、アイデア自体は、その具体的な表現とは対照的に、著作権によって保護されないとされています。

ただし、これは個人的な見解であり、各管轄区におけるさらなる裁判所の判決を待って、慎重に解釈する必要があります。

AI 開発者と企業にとって、コピーレフト ライセンスと寛容ライセンスの違いを理解し、AI モデルの使用目的と配布計画に沿ったライセンスを選択することが重要です。 AI の開発と法的安全性の両方を確保するために最適なライセンスを選択するには、商用利用、データのオープン性、特許保護などのさまざまな要素を考慮することが重要です。 AIトレーニングにおける著作権の問題は複雑であり、各国の法基準やガイドラインを継続的に監視し、適切に対応することが重要です。