OceanBaseはV4.3.3からベクトル型データの格納、ベクトルインデックス、そしてembeddingベクトル検索機能をサポートしています。これにより、ベクトル化したデータをOceanBaseに保存し、次の検索処理で利用できるようになりました。
Firecrawlは、開発者があらゆるウェブサイトから高品質なデータをスクレイピングし、AIアプリケーションの構築に活用できるツールです。このツールは、高度なWebスクレイピング、クローラー、データ抽出機能を備えており、ウェブコンテンツを効率的にクリーンなマークアップ言語や構造化データに変換し、下流のAIワークフローの要件を満たせます。
本チュートリアルでは、OceanBaseとFirecrawlを使用して検索拡張型生成(RAG)パイプラインを構築する方法を紹介します。このパイプラインは、ネットワークデータのスクレイピングにFirecrawl、ベクトルストレージにOceanBase、洞察に富んだコンテキスト認識応答の生成にJina AIを統合したものです。
前提条件
- ご利用の環境にトランザクション型(MySQL)クラスタインスタンスが利用可能であること。
テナントの作成は、テナントの作成を参照してから、以下の手順を実行してください。
ご利用の環境に、使用可能なMySQL互換モードのテナント、MySQLデータベース、およびデータベースアカウントが既に存在し、データベースアカウントに読み書き権限が付与されていること。作成が必要な場合は、詳細についてはアカウントの作成およびデータベースの作成(MySQL専用)をご参照ください。
プロジェクト管理者またはインスタンス管理者ロールを持ち、プロジェクト内のインスタンスに対して読み書き操作を実行できること。権限がない場合は、組織管理者に連絡して権限の追加を依頼してください。
Python 3.11以降のバージョンをインストールしていること。
依存関係をインストールしていること。
python3 -m pip install firecrawl-py pyobvector requests tqdm
ステップ1:データベース接続情報を取得する
ドロップダウンリストから、ID でクラスタインスタンスを選択します。
**概要**ページに移動します。
接続をクリックし、**接続文字列を取得**を選択します。
ポップアップウィンドウで、**パブリックネットワークを使用する**を選択します。
アクセスアドレスを取得し、**現在のブラウザIPアドレスを追加**を選択します。
データベース関連情報を入力し、**接続文字列をコピー**します。
ステップ2:AIアシスタントを構築する
FirecrawlでWebページの情報をスクレイピングしてOceanBase Vectorに保存し、検索を実行します。
環境変数の設定
Firecrawl APIキーを取得し、OceanBaseの接続情報と共に環境変数に設定します。
export OCEANBASE_DATABASE_URL=YOUR_OCEANBASE_DATABASE_URL
export OCEANBASE_DATABASE_USER=YOUR_OCEANBASE_DATABASE_USER
export OCEANBASE_DATABASE_DB_NAME=YOUR_OCEANBASE_DATABASE_DB_NAME
export OCEANBASE_DATABASE_PASSWORD=YOUR_OCEANBASE_DATABASE_PASSWORD
export FIRECRAWL_API_KEY=YOUR_FIRECRAWL_API_KEY
export JINAAI_API_KEY=YOUR_JINAAI_API_KEY
サンプルコード
FirecrawlによるOceanBase公式Webサイトのクロール
import os ,requests
from firecrawl import FirecrawlApp
from sqlalchemy import Column, Integer, String
from pyobvector import ObVecClient, VECTOR, IndexParam, cosine_distance
from tqdm import tqdm
def split_markdown_content(content):
return [section.strip() for section in content.split("# ") if section.strip()]
app = FirecrawlApp(api_key=os.environ["FIRECRAWL_API_KEY"])
# Scrape a website:
scrape_status = app.scrape(
url="https://en.oceanbase.com/docs/common-oceanbase-database-10000000001970957",
formats=["markdown"]
)
markdown_content = scrape_status.markdown
# Process the scraped markdown content
sections = split_markdown_content(markdown_content)
Jina AIのベクトルを取得する
Jina AIはさまざまなベクトルモデルを提供しており、ユーザーはニーズに応じて対応するモデルの使用を選択できます。 ここでは、jina-embeddings-v3を例に、Jina AIのベクトルAPIを呼び出すための補助関数generate_embeddingsを定義します。
JINAAI_API_KEY = os.getenv('JINAAI_API_KEY')
def generate_embeddings(text: str):
JINAAI_API_URL = 'https://api.jina.ai/v1/embeddings'
JINAAI_HEADERS = {
'Content-Type': 'application/json',
'Authorization': f'Bearer {JINAAI_API_KEY}'
}
JINAAI_REQUEST_DATA = {
'input': [text],
'model': 'jina-embeddings-v3' # with dimension 1024.
}
response = requests.post(JINAAI_API_URL, headers=JINAAI_HEADERS, json=JINAAI_REQUEST_DATA)
return response.json()['data'][0]['embedding']
data = []
for i, section in enumerate(tqdm(sections, desc="Processing sections")):
try:
embedding = generate_embeddings(section)
truncated_content = section[:4900] if len(section) > 4900 else section
data.append({"content": truncated_content, "content_vec": embedding})
except Exception as e:
print(f"Error processing section {i}: {e}")
continue
ベクトルテーブル構造を定義し、ベクトルをOceanBaseに格納する
firecrawl_oceanbase_demo_documentsという名前のテーブルを作成し、テキストを格納するcontent列、ベクトルを格納するcontent_vec列、およびベクトルインデックス情報を含みます。
OCEANBASE_DATABASE_URL = os.getenv('OCEANBASE_DATABASE_URL')
OCEANBASE_DATABASE_USER = os.getenv('OCEANBASE_DATABASE_USER')
OCEANBASE_DATABASE_DB_NAME = os.getenv('OCEANBASE_DATABASE_DB_NAME')
OCEANBASE_DATABASE_PASSWORD = os.getenv('OCEANBASE_DATABASE_PASSWORD')
client = ObVecClient(uri=OCEANBASE_DATABASE_URL, user=OCEANBASE_DATABASE_USER,password=OCEANBASE_DATABASE_PASSWORD,db_name=OCEANBASE_DATABASE_DB_NAME)
table_name = "firecrawl_oceanbase_demo_documents"
client.drop_table_if_exist(table_name)
cols = [
Column("id", Integer, primary_key=True, autoincrement=True),
Column("content", String(5000), nullable=False),
Column("content_vec", VECTOR(1024))
]
# Create vector index
vector_index_params = IndexParam(
index_name="idx_content_vec",
field_name="content_vec",
index_type="HNSW",
distance_metric="cosine"
)
client.create_table_with_index_params(
table_name=table_name,
columns=cols,
vidxs=[vector_index_params]
)
print('- Inserting Data to OceanBase...')
client.insert(table_name, data=data)
セマンティック検索
Jina AIのAPIを使用してクエリテキストのベクトルを生成し、その後、クエリテキストのベクトルとベクトルテーブル内の各ベクトルとのコサイン距離に基づいて、最も関連性の高いドキュメントを検索します。
query = 'what is OceanBase High compatibility'
# Generate the embedding for the query via Jina AI API.
query_embedding = generate_embeddings(query)
res = client.ann_search(
table_name,
vec_data=query_embedding,
vec_column_name="content_vec",
distance_func=cosine_distance, # コサイン距離関数を使用
with_dist=True,
topk=1,
output_column_names=["id", "content"],
)
print('- The Most Relevant Document and Its Distance to the Query:')
for row in res.fetchall():
print(f'- ID: {row[0]}\n'
f' content: {row[1]}\n'
f' distance: {row[2]}')
期待される結果
- ID: 5
content: High compatibility
OceanBase Database is highly compatible with most general features of Oracle and MySQL, and supports advanced features such as procedural language and triggers. OceanBase Migration Service (OMS), an automatic migration tool, is provided to support migration assessment and reverse synchronization to ensure data migration security when a core system is migrated to OceanBase Database in key industries such as finance, public governance, and communication service.
##
distance: 0.2341035693195166