近年、AI技術が日々進化する中、この分野のリーディングカンパニーであるOpenAIは、自然言語処理、マルチモーダル処理、コード生成・編集、画像生成、音声認識など幅広い分野で様々な特許を取得しています。このコラムでは、OpenAIの主な登録特許を丁寧に分析し、それぞれの特許がカバーする問題点と解決策について詳しく見ていきたいと思います。各特許の重要な詳細、市場への適用可能性、技術的/法的影響について説明します。
1. OpenAIのAI特許の概要 OpenAIが申請・登録している主なAI特許は以下の通りで、大規模言語モデル(LLM)、マルチモーダルAI、自動コーディング、音声認識、画像処理、外部API統合などの技術をカバーしています。 2025 年 2 月 3 日の時点で、OpenAI は合計 14 件の米国特許を取得しています。
タイトル
申請番号
登録番号
IPC
アダプティブ UI によるアシスタント メッセージの豊富な出力レンダリング
18-606435
12164548
G06F-040/30
大規模な言語モデルと対話するためのシステムと方法
18-475722
12051205
G06T-007/10
マルチモーダル機械学習モデルと対話するためのシステムおよび方法
18-475588
12039431
G06N-003/0455
スキーマベースの外部 API と自然言語アプリケーションの統合
18-474063
12124823
G06F-008/35
機械学習モデルを使用した画像生成のシステムと方法
18-458907
11983806
G06K-009/36
コンピュータコードで訓練された言語モデルを使用してコードを生成するシステムと方法
18-321852
12061880
G06F-008/30
コンピュータコードで訓練された言語モデルを使用して自然言語を生成するシステムと方法
18-321921
12008341
G06F-008/30
機械学習を使用してモデルをトレーニングおよび使用し、ビデオおよび入力データセットに基づいて自動インターフェイス アクションを実行する
18-303552
11887367
G06V-020/40
マルチタスク自動音声認識システム
18-302289
12079587
G06F-040/58
階層的なテキスト条件付き画像生成のためのシステムおよび方法
18-193427
11922550
G06T-011/60
スキーマベースの外部 API と自然言語アプリケーションの統合
18-186712
11922144
G06F-008/35
言語モデルベースのテキスト編集のためのシステムと方法
18-183902
11983488
G06F-040/166
言語モデルベースのテキスト挿入のためのシステムと方法
18-183898
11886826
G06F-017/00
対照的な事前トレーニングを使用してテキストとコードの埋め込みを生成するシステムと方法
18-158166
12073299
G06N-020/00
2. 各主要特許の主要な内容分析と代表的なクレーム 以下の特許は、OpenAIが提供する代表的なサービス(ChatGPT、DALL・E、Codex、Whisperなど)に直接関連するコアAI技術をカバーしています。すでに市場で高い評価を得ているChatGPTやDALL/Eもこの特許技術をベースに動作し、他社との差別化された機能を提供しています。それぞれの特許がどのような問題を解決し、どのような技術的特徴を持っているのかを詳しく見ていきましょう。
(1) アシスタント メッセージのリッチな出力レンダリングのためのアダプティブ UI 目的
単なるテキストチャット環境を超えて、視覚的・構造化された情報を自由に表現できるUIシステムを構築したい OpenAI の ChatGPT などの対話型モデルは、豊富なグラフ、表、画像を提供することで、より直感的な情報をユーザーに提供するのに役立ちます コアソリューション
生成言語モデル (LLM) + フロントエンド レンダリング構造LLM は質問と回答またはデータ分析結果を構造化します (プリミティブを使用) フロントエンド (UI) はそれらを視覚要素 (グラフ、ダッシュボードなど) に自動的に変換します。 将来的には、ChatGPT インターフェイスは、単純なテキストだけでなく、グラフや表などの視覚的な回答を直接表示するのに有益になるでしょう。 使用例
データ分析 :ChatGPT Enterprise版でのグラフや統計結果のリアルタイム表示作業補助ツール : カスタマーサポートや販売ダッシュボードなどのインタラクティブなレポートを提供します代表的主張1
方法 A: 言語モデル生成応答エンジンによる提案。ユーザー アカウントとフロントエンドによって提示される言語モデル生成応答エンジンの間のチャット スレッド内で応答を生成するための自然言語による最初のプロンプト。ここで、言語モデルの生成応答エンジンは、応答を生成するためのプリミティブのコレクションからの最初のプリミティブをいつ応答とみなすべきかを決定するために考慮されており、最初のプリミティブは、最初のプリミティブによって定義された構造化データを含む初期応答を出力する言語モデルの生成応答エンジンを表します。 言語モデル生成応答エンジンによって最初のプリミティブを呼び出します。 言語モデル生成応答エンジンによる応答。第1のプロンプトおよび第1のプリミティブに基づいて単語のシーケンス内の次の単語を予測することによって初期応答を生成し、第1のプリミティブによって定義された構造化データとみなされる単語のシーケンスで構成される初期応答を生成する。フロントエンドを使用して、初期応答を視覚的な形式の構造化データとしてレンダリングします。 完成した応答を出力します。完成した応答には、視覚的な形式でレンダリングされた構造化データが含まれます。 (2) 大規模言語モデルへの介入のためのシステムと方法 目的
OpenAI が提供する大規模言語モデル (GPT ファミリ) に画像などのマルチモーダル入力を組み込むことで、より豊かなユーザー エクスペリエンスを作成します。 たとえば、ChatGPT に画像をアップロードした後、画像を説明したり、特定の領域で回答を要求する関数を実装します。 コアソリューション
グラフィカル ユーザー インターフェイス (GUI) インタラクションユーザー: テキストクエリ+提供された画像 モデル: テキストと画像の組み合わせ分析 → 画像内の特定の場所を強調表示 「ChatGPTが画像内の物体を認識し、その部分だけを拡大したり説明したりする」などの高度な機能のサポート 使用例
ビジュアルチュートリアル :ユーザーがアップロードした製品写真をもとにマニュアル・マニュアルを自動生成マルチモーダルサポートChatGPT : 画像、テキスト、音声入力を統合して強力なオールラウンド インタラクティブ エージェントを構築します (Whisper)代表的主張1
マルチモーダル機械学習モデルを使用した学習方法。次の学習方法です。 マルチモーダル機械学習モデルに関連付けられたグラフィカル ユーザー インターフェイス。 グラフィカル ユーザー インターフェイスで画像をユーザーに変換します。 ユーザーからのプロンプトを表示します。 画像と提案されたプロンプトを使用します。 マルチモーダル機械学習モデルへの入力データを考慮して出力を少なくとも部分的に結合し、プロンプトエンジニアリングを使用してマルチモーダル機械学習モデルを構成して、画像内の位置を特定する 画像とプロンプト上。出力内の最初の場所。そして、グラフィカル ユーザー インターフェイスで、画像の最初の位置にあるインジケーター ここで、画像内の最も重要な最初の位置にある重要なインジケータが、画像内の最初の位置にグラフィカル ユーザー インターフェイスのカーソルとして表示されます。 (3) マルチモーダル機械学習モデルによる理解のためのシステムと方法 目的
テキスト+画像を同時に受信することでユーザーとAIのビジュアルコミュニケーション向上を目指す DALL・E、CLIP、WhisperなどのOpenAIマルチモーダルモデルのインタラクションインターフェースを強化するコアテクノロジー コアソリューション
画像の強調表示: GUI に画像が表示され、モデルはテキスト クエリに従って特定の点 (座標) を見つけ、カーソルまたはボックスでそれを強調表示します。 モデルによって認識された結果をユーザーに直接視覚化することで、信頼性とアクセシビリティを向上します。 使用例
インタラクティブなデザインツール : 「このロゴの何がそんなに気まずいのですか?」 → モデルはロゴの問題領域を強調表示します医療・製造業 : X線およびCT画像を分析して、工程検査画面上で疑わしい領域を表示したり、欠陥の位置を強調表示します。代表的主張1
事前にトレーニングされたマルチモーダル機械学習モデルを使用して学習する方法。次の学習方法です。 ユーザーが画像と対話して、画像内の対話領域を説明する競合プロンプトを生成できるように構成されたグラフィカル ユーザー インターフェイスについて説明します。 征服プロンプトの確認。 画像と征服プロンプトを使用したディスカッション入力データ。 マルチモーダル機械学習モデルへの入力データを評価し、接続プロンプト上で画像に対する測定された応答を条件付けすることで、画像に対する応答を記述します。そしてユーザーへの自粛対応 、ありそうもない応答ではプロンプトが表示され、選択可能なコントロールを選択してください ユーザーがプロンプトを選択できるように構成されたグラフィカル ユーザー インターフェイス内 (4) 外部 API と自然言語アプリケーションとのスキーマベースの統合 (登録番号: 12124823) 目的
OpenAIが提供する対話型モデル(ChatGPTなど)と外部APIとの統合を簡素化することで、AIによるプラグインなどのさまざまな機能の実行をサポートします。 実際、ChatGPT プラグイン システムは同様の概念に基づいており、さまざまなサードパーティ アプリに接続して API を自動的に呼び出し、結果をユーザーに返します。 コアソリューション
マニフェスト ファイルによる API スキーマの定義APIの使用方法やリクエスト/レスポンスの形式をモデルが理解できる形式で提供します LLM はユーザーの自然言語リクエストを分析し、どの API をどのように呼び出すかを決定します。 実際の ChatGPT プラグイン システムと同様に、開発者がマニフェストを提供すると、ChatGPT はプラグインを使用してさまざまな機能を実行します。 使用例
プラグインのスケジュール設定 : ユーザーが「スケジュールに会議を追加」と言うと、カレンダー API が自動的に呼び出されます。買い物・注文機能 : 「ピザを注文」 → レストラン API を呼び出した後、結果 (メニュー、支払いオプションなど) を返す代表的主張1
コンピュータによる評価方法は次のように説明します。 第1の場所に格納される第1のマニフェストファイルを記述し、第1のマニフェストファイルは、第1のウェブアプリケーションプログラミングインターフェース(API)に関連付けられた第1のトレーニングデータを含む... 第1のトレーニングデータおよび第1のウェブAPIの第1の記述に基づいてモデルをトレーニングする。 3 番目の場所に保存されている 2 番目のマニフェスト ファイルを記述します。2 番目のマニフェスト ファイルには、2 番目の Web API に関連付けられた 2 番目のトレーニング データが含まれています...モデルのユーザー インターフェイスに入力を入力します。 入力に、第 1 の Web API または第 2 の Web API をユーザー インターフェイスと統合するリクエストが含まれるかどうか。1 つ以上の関数呼び出しを変換して、最初の Web API または 2 番目の Web API に送信する 受け取った入力の分析に基づいて...モデルを再トレーニングする 第1のトレーニングデータ、第1のウェブAPIの第1の記述、第2のトレーニングデータ、または第2のウェブAPIの第2の記述のうちの1つ以上に対して行われた少なくとも1つの変更に基づく (5) 機械学習モデルを用いた画像生成システムと方法 目的
テキストベースの画像作成サービスであるDALL/Eシリーズモデルにおいて、既存画像の特定部分を自由に置き換え、修正(インペイント)、強化(エンハンス)する技術 マスキングにより、画像の一部を削除し、新しい要素をテキストで示し、目的の結果を再構築できます。 コアソリューション
マスキングと再生成元の画像 → 特定の領域をマスク → 「ここに虹を追加」などのテキスト指示 → モデルが自然なピクセルを生成 Blind Super Resolutionなどによるノイズ除去や解像度補正機能も搭載 使用例
DALL・Eベースの写真編集 :ポートレート写真の背景の変更、項目の追加/削除、色や明るさの自動調整などを行います。マーケティング/デザイン : 製品広告用の画像を作成する際のアイデアを迅速かつクリエイティブに視覚化します。代表的主張1
提示されたシステム: ...入力イメージからマスクされた領域を関与させることにより、マスクされたイメージを関与させます 、マスクされた領域のどこにありますか。ピクセル値はマスクされた領域に記憶されます。 画像プロンプトに入力されたテキストを削除します。 入力画像、マスクされた領域、またはテキスト入力の少なくとも 1 つを、強化された画像を生成するように構成された機械学習モデルに結合します。、機械学習モデルを使用して、強化された画像 入力画像、マスクされた領域、またはテキスト入力のうちの少なくとも 1 つに基づきます。 強化された画像の生成の場所:複製されたピクセル値 入力画像またはマスクされた画像から強化された画像へ。 機械学習モデルでは、テキスト入力またはマスクされた画像のピクセル値の少なくとも 1 つに基づく画像セグメント。そして画像セグメントを調整する マスクされた領域を引き付けて強化された画像に。 (6) コンピュータコードの解析による言語モデルを用いたコード理解システムと方法 目的
OpenAI が提供する Codex (または ChatGPT Code Assistant) などのモデルは、適切なコードを生成するための開発者の自然言語要件をサポートします。 目標は、テストの実行結果を検証することでコードの品質を向上させ、開発の生産性を最大化することです。 コアソリューション
コード+アノテーションの学習: 大規模なオープンソース コードとコメント (dostring) に基づいて学習した LLM の使用 モデルは複数のコードを試してテストした後、最終的に正しく動作するコードを選択して提案します。 使用例
ChatGPTコーディングアシスタント : 「Python で QuickSort 関数を作成する」と言うと、コードが自動的に作成され、テストされます。IDEの統合 :Visual Studio CodeやJetBrainsなどの開発環境にプラグインとして挿入することで自動的に提案されます。代表的主張1
コンピュータで評価される方法は、次のように実行されます。 docstring 自然言語テキスト デジタル プログラミング結果。、機械学習モデルを使用し、docstring に基づいて、1 つ以上のコンピューター コード サンプル 候補結果を生成するように構成されています。 テスト環境でテストされる 1 つ以上のコンピューター コード サンプルのそれぞれについて話し合う... テスト環境の結果に基づいて、特定の候補結果を示したコンピューター コード サンプルの少なくとも 1 つ...、機械学習モデル、自然言語テキストを使用 少なくとも 1 つの特定されたコンピュータ コード サンプルに関連付けられ、1 つ以上のコンピューター コード サンプルをそれぞれ検証する ;そして 少なくとも 1 つの特定されたコンピューター コード サンプルの概要を説明しました... (7) コンピュータコード上で操作する言語モデルを使用した計算自然言語のためのシステムおよび方法 目的
ソースコードからドキュメント(コメント・説明)を自動生成する技術で、CodexやChatGPTなどの「この機能は何をする機能ですか?」自分たちで説明してもらいましょう 大規模プロジェクトにおけるコメントの欠落やメンテナンスの問題を解決し、コードの理解を向上させることが目的 コアソリューション
リバースドキュメンテーション: 関数のシグネチャとコード フローを分析し、自然言語の要約 (dostring) を生成します。 コードを書いた後、開発者がモデルを呼び出して「この機能の説明を書いてください」 → 読みやすい文章を自動で提供 使用例
アノテーション自動生成ツール : ChatGPT は、新しいコードを記述するたびにドキュメントをサポートします教育プラットフォーム : 初心者の開発者がオープンソース コードを学習すると、各機能の説明が自動的に表示され、理解が深まります。代表的主張1
コンピュータで評価される方法は、次のように実行されます。 機械学習モデルをトレーニングして、コンピューターコードから自然言語のドキュメント文字列を生成する ; 機械学習モデルにおける 1 つ以上のコンピューター コード サンプル。、機械学習モデルを介して、受信した 1 つまたは複数のコンピューター コード サンプルに基づいて、1 つまたは複数の候補の自然言語 docstring ... 1つ以上のコンピュータコードサンプルの少なくとも一部の意図を提供する1つ以上の候補自然言語ドキュメントストリングのうちの少なくとも1つを考慮する。学習された機械学習モデルからのアウトバウンド 少なくとも 1 つの識別された自然言語文書文字列 1 つまたは複数のコンピュータ コード サンプルの少なくとも一部を使用して... (8) 機械学習を使用してモデルをトレーニングおよび使用し、ビデオおよび入力データセットに基づいて自動インターフェイス アクションを実行する 目的
大量のラベルなしビデオ データを使用して、UI 上で自動アクション (クリック、ドラッグなど) を実行するモデルをトレーニングします。 OpenAIが将来実現可能な「視覚情報+自動タスク」システム(自動ブラウザナビゲーション、RPAなど)と連携 コアソリューション
逆ダイナミクスモデルを使用して擬似ラベルを作成するビデオの過去と未来のフレームを見て、その途中でどのようなアクション (マウスの動き、キーボードの入力) が発生したかを推測します。 漸進的学習: これらの推論されたアクション ラベルを使用して、自動インターフェイス作業モデルのパフォーマンスを向上させます。 使用例
ブラウザの自動化 : 画面記録を通じてモデルが学習し、フォーム入力とファイルアップロードを自動的に繰り返しますソフトウェアテスト : 回帰テストや UI 検証をビデオレベルで学習することで、人的資源の消費を最小限に抑えます。代表的主張1
自動化されたアクションを実行するように機械学習モデルをトレーニングする方法は、次のように実行されます。 未決定のデジタルビデオデータ。知られざるデジタルビデオデータの危険な擬似ラベル 、最も有名なもの: デジタルグレードのデジタルビデオデータ。 集中的なデジタルビデオデータを使用して、逆ダイナミクスモデル(IDM)を含む第1の機械学習モデルをトレーニングするステップと、そして少なくとも 1 つの疑似ラベル 計り知れないデジタルビデオデータのために...少なくとも 1 つの疑似ラベルを追加する 未発表のデジタルビデオデータに変換して、擬似予測デジタルビデオデータを形成する。そして 疑似集中デジタル ビデオ データを使用して、最初の機械学習モデルまたは 2 番目の機械学習モデルをさらにトレーニングします... (9) マルチタスク自動音声認識システム 目的
OpenAIのWhisperモデルと同様に、多言語およびマルチタスクの音声認識が単一のトランスフォーマーで実行され、大規模な音声データの転記および翻訳の効率が向上します。 英語、スペイン語、韓国語などの多言語を1台でカバーし、文字起こし・翻訳作業を同時処理 コアソリューション
マルチタスク トレーニング: 同じ言語の文字起こしや異なる言語への翻訳など、単一のモデルからさまざまなタイプのラベル オーディオを学習します。 デコーダ入力に言語トークンやタスクトークンなどを追加して、「この入力は韓国語翻訳」か「英語からフランス語への翻訳」かを区別します。 使用例
世界規模のサービス : ChatGPT がグローバル音声入力を受け取ると、関連する言語に従って自動的に文字起こしまたは翻訳します。会議メモを自動的に作成する : 多言語会議でも 1 つのモデルだけでリアルタイムにスクリプトを生成代表的主張1
提示されたシステム: 少なくとも 1 つのメモリ集中型命令。そして 多言語、マルチタスクの音声認識のための操作を実行する命令を実行するように構成された少なくとも1つのプロセッサであり、実行される操作は、 トランスモデルのご紹介です...入力音声セグメントから出力トランスクリプトを入力します Transformers モデルを使用して、以下を含む生成を行います。 第一言語に説明する言語トークンを使用してデコーダ入力を変換します。 デコーダ入力にタスク トークンを含めます。そして 自己回帰的にデコーダー入力に最初のタイムスタンプ トークンを提示します... (10) 階層的なテキスト条件付き画像生成のためのシステムおよび方法 目的
DALL/E などのテキスト条件に基づく画像生成モデルは、高解像度画像の段階的な生成を可能にする階層構造を提供します。 テキスト入力 → 低解像度ベース画像 → アップサンプリングを順次実行して詳細な結果を取得 コアソリューション
複数のサブモデル低解像度画像の生成 (最初のサブモデル) 高解像度アップサンプリング (2 番目のサブモデル) ブラインド超解像度 (BSR) でノイズや低品質の画像を正確に補正 使用例
ダルエ :「画家ゴッホ風に猫の絵を描く」 → 低解像度の下書きを作成 → アップサンプリング段階で鮮明な画像を完成高品質の広告/マーケティング画像 : テキストアイデアのみを使用してプロレベルの詳細な画像を抽出し、ブランドマーケティングに使用します代表的主張1
提示されたシステム: ...テキスト説明または最初のサブモデルに埋め込まれたテキストの少なくとも 1 つを通知 テキスト記述またはテキスト埋め込みのうちの少なくとも1つに基づいて、提案された画像埋め込みを生成するように構成され、 テキスト記述または提案された画像の少なくとも 1 つが、出力画像を生成するように構成された第 2 のサブモデルに誤って埋め込まれてしまいます。 ここで、2 番目のサブモデルには、1 番目のアップサンプラー モデルと 2 番目のアップサンプラー モデルが含まれています...2 番目のアップサンプラー モデルは、ブラインド超解像度 (BSR) に成功した画像を表示します ;そして 出力イメージをデバイスにアクセスできるようにしています... (11) 外部 API と自然言語アプリケーションとのスキーマベースの統合 (登録番号: 11922144) 目的
特許第4号と同様、ChatGPT Plugin方式を利用して外部APIを容易に統合する技術 モデルはマニフェストを通じて API 呼び出しプロセスを自動的に理解して使用し、機能のスケーラビリティを強化します。 コアソリューション
マニフェストのカスタマイズ: サードパーティ API プロバイダーは、認証、エンドポイント、応答形式を JSON スキーマとして定義します。 モデルはユーザーのリクエストに基づいて API を呼び出し、応答を自然言語で要約して返します。 使用例
ChatGPT プラグイン エコシステム : 旅程管理、旅行予約、銀行取引、オンラインショッピングなどの各種プラグインを追加企業内システムの統合 : 社内 ERP および CRM に接続して、特定の社内データを対話的にクエリします代表的主張1
自然言語モデルのユーザー インターフェイスを使用して特定の外部アプリケーション プログラミング インターフェイス (API) を識別するためのコンピューター解釈型の方法を示します。自然言語モデルのユーザー インターフェイスに最初の入力を入力します。 マニフェストに基づいて 1 つ以上の関数を呼び出すことを目的とした自然言語モデルに通信可能に接続されています... 最初の入力には、特定の外部 API を統合するリクエストが含まれます...特定の外部 API を拡張する 受け取った最初の入力に基づきます。 は自然言語モデル ユーザー インターフェイスを使用して特定の外部 API を説明し、 は特定の外部 API の説明、Web API の説明、およびマニフェストを説明します...最初の入力または 2 番目の入力に基づいて特定の外部 API を検討する ... 応答、応答に基づく応答、自然言語モデル ユーザー インターフェイスへの応答メッセージ、応答の結果を含む応答メッセージ... (12) 言語モデルに基づくテキスト編集のためのシステムおよび方法 目的
ChatGPT などの OpenAI 言語モデルを使用して、ドキュメントの下書きを自動的に修正および編集することで、コンテンツの作成および編集プロセスを合理化します。 ユーザーが「この段落をもっと簡潔に」「ビジネススタイルに変更して」と言ったら、すぐに変更します。 コアソリューション
プロンプトベースの編集: 特定の領域と編集スタイル (フォーマル、フレンドリーなど) を指定すると、モデルは部分的なテキストを置き換えます。 結果が気に入らない場合は、ユーザーに再編集する 2 番目のコマンドを与えます (反復編集) 使用例
ブログ投稿 : ChatGPT は長い下書きを簡潔な方法で圧縮したり、SEO キーワードを自動的に挿入したりしますビジネスメール :テンプレートなしでモデルの修正・修正が可能なレベルの文章を生成し、即送信代表的主張1
提示されたシステム: ...入力テキスト プロンプトを受け入れると、入力テキスト プロンプトは null セットを提案します。 指示 1 つ以上のユーザー指示。 1つ以上のユーザー指示に基づいてモデルパラメータのセットを記述します。 言語モデルを含めると...、言語モデルを使用した出力テキスト 入力テキスト プロンプト、1 つ以上のユーザー指示に基づいて...言語モデルと 1 つ以上の新しいユーザー指示に基づいて出力テキストを編集する 出力テキストの少なくとも一部を処理することによって。そして 言語モデルの主張による言語モデルの主張... (13) 言語モデルベースのテキストフォーマットのためのシステムおよび方法 目的
既存のテキスト文書や会話の途中に文章を自動で挿入(挿入)し、自然に完成度を高めるモデルです。 ChatGPT は特定のセクションを認識し、必要な情報や例文を追加して投稿をより充実させます コアソリューション
文脈分析:前後の文章を確認し、挿入する内容が全体の流れと一致するようにモデルを作成 「ここに例を示してください」 → 関連する例や類推をその場で作成することで、記事全体の完全性を強化します 使用例
論文・レポートの書き方:章間に補足説明や事例を挿入する。 小説・シナリオ:セリフや設定説明など必要な部分をモデルが積極的に埋めていきます。 代表的主張1
以下を含むシステム:プレフィックス部分とサフィックス部分を含む入力テキストプロンプトを受信する。 入力テキストプロンプトに基づいてモデルパラメータのセットを決定する。 言語モデルにアクセスしています...コンテキストパラメータのセットを決定する 入力テキストプロンプトおよび言語モデルに基づいて、コンテキストパラメータのセットは、場所、人、時間、またはイベントのうちの少なくとも1つを含む。コンテキストパラメータのセットに基づいて言語モデル出力テキストを生成する そして言語モデル。言語モデル出力テキストの挿入 テキスト入力プロンプトに... アクセスされた言語モデルを最適化しています... (14) 対照的な事前トレーニングを使用してテキストとコードの埋め込みを生成するシステムと方法 目的
検索、推奨事項、ドキュメントの分類に使用するために、テキストとコード間の意味上の類似性を効率的に計算する埋め込みを作成します。たとえば、システムは、特定の関数の説明に類似したコードを検索したり、意味が密接に関連している 2 つのテキストを照合したりできます。
コアソリューション
対照学習 : 類似したサンプルのベクトルを近づけ、異なるサンプルのベクトルを遠ざけることによってトレーニングします。OpenAI は、テキストとコードを同時に学習するモデル (Codex、CLIP など) を活用して、検索および推奨システムを強化します。 使用例
ChatGPT プラグイン : ユーザーが特定のコード部分を記述すると、モデルは埋め込みを比較し、最も適合するライブラリ関数を推奨します。文書検索エンジン : FAQ データ、顧客の質問などを意味のあるベクトル表現に変換し、より迅速な検索を実現します。代表的主張1 ベクトル表現に基づいて意味的類似性を生成するためのコンピュータ実装方法であって、この方法は、
ラベルなしデータから抽出されたトレーニング データ セットを受け取る。トレーニング データ セットには、正例ペアに対応する複数のペア データ サンプルが含まれます。 正例ペアに対応するペアデータサンプルをベクトル表現の少なくとも1つの第1ベクトルに変換するステップと、 1 つ以上の負の例のペアにアクセスしています… 1 つ以上の負の例のペアを 1 つ以上の 2 番目のベクトルに変換します… 機械学習モデルをトレーニングしてベクトル表現の追加ベクトルを生成するステップであって、トレーニングは以下を含む:1 つ以上の事前トレーニングされたモデルを使用して機械学習モデルを初期化しています… 対照的なトレーニングを使用して機械学習モデルをトレーニングする… 意味上の類似性に関するクエリを受信中… 機械学習モデルを使用し、埋め込み空間に従って、クエリに応じて意味的類似性の結果を生成する。 これらの特許は、ChatGPT、DALL・E、Whisper、Codex など、OpenAI のほとんどのサービスの背後にある基盤テクノロジーとして機能します。会話型 UI から画像生成、音声認識、コード自動化、外部 API 統合まで、幅広い範囲にわたる各特許はシームレスに相互接続され、「AI プラットフォーム エコシステム」と言えるものを形成しています。
3. 特許の動向とその影響 マルチモーダル AI と UI/UX イノベーション 画像、テキスト、音声、動画など複数の形式のデータを同時に処理できる技術が普及し、UI/UXはより直観的で充実したものになっています。LLM の拡張: コード生成、翻訳、および編集 自動コード生成、ドキュメント編集、および注釈により、開発者とドキュメント チームの作業負荷が大幅に自動化および強化されます。これは、企業の生産性の向上、人件費の削減、市場投入までの時間の短縮につながります。外部API連携によるプラットフォーム化 AI モデルは、機能を拡張するためにさまざまなサードパーティ API を直接呼び出すようになりました。会話型 AI サービスがプラットフォームに進化するにつれて、これらのサードパーティ API はプラグインのようにシームレスに統合できます。トレーニングの効率と精度の向上 対照学習、擬似ラベル付け、その他の手法は、ラベルなしデータを最適に利用するのに役立ち、それにより精度と汎用性が向上します。大規模な言語モデルと視覚モデルはより洗練されており、ゼロショットまたは数ショットのシナリオでも高いパフォーマンスが可能になります。4. 結論 OpenAI の特許ポートフォリオは、マルチモーダル システム、大規模言語モデル (LLM)、外部 API 統合、コード自動化、高解像度画像生成、音声認識を含む AI の将来の方向性を示しています。大手企業は、独自技術を保護し、拡張するための広範な特許戦略をすでに持っています。Pine IP Firm は、特許明細書の草案作成、出願、侵害対応、紛争解決など、AI およびソフトウェア特許戦略におけるプロフェッショナル サービスを提供しています。 AI における競争が激化する中、技術革新を保護するために知的財産権が不可欠です。 OpenAI の例のように、早期の特許取得戦略が大規模な投資と独占的な技術を支えていますが、貴社も堅牢な特許戦略を確立する必要があります。独自の AI テクノロジーをしっかりと保護したい場合は、Pine IP Firm と協力して段階的な計画を策定することをお勧めします。