Toki-AI
/

llm-jp-3-13b-finetune-241202_lora-DPO-12-17

@@ -11,150 +11,130 @@ language:
 - en
 ---
-# Uploaded  model
-- **Developed by:** Toki-AI
-- **License:** apache-2.0
-- **Finetuned from model :** llm-jp/llm-jp-3-13b
-This llama model was trained 2x faster with [Unsloth](https://github.com/unslothai/unsloth) and Huggingface's TRL library.
 [<img src="https://raw.githubusercontent.com/unslothai/unsloth/main/images/unsloth%20made%20with%20love.png" width="200"/>](https://github.com/unslothai/unsloth)
 !pip list
-from unsloth import PatchDPOTrainer
-PatchDPOTrainer()
 from unsloth import FastLanguageModel
 import torch
-max_seq_length = 2048 # Choose any! We auto support RoPE Scaling internally!
-dtype = None # None for auto detection. Float16 for Tesla T4, V100, Bfloat16 for Ampere+
-load_in_4bit = True # Use 4bit quantization to reduce memory usage. Can be False.
-HF_TOKEN = "your_token"#ご自身のToken
 model, tokenizer = FastLanguageModel.from_pretrained(
-    model_name = "Toki-AI/llm-jp-3-13b-finetune-241202", # 自分がUnslothを使ってFTして、loraだけアップロードしているモデル
     max_seq_length = max_seq_length,
     dtype = dtype,
     load_in_4bit = load_in_4bit,
-    token = HF_TOKEN,
 )
-from huggingface_hub import login
-# 生成したトークンをペースト
-login(HF_TOKEN)
-from datasets import load_dataset
-# データセットをロード
-ds = load_dataset("weblab-GENIAC/aya-ja-nemotron-dpo-masked")
-# フィルタリング関数を定義
-def filter_short_examples(example):
-    return (
-        len(example['prompt']) <= 2000 and
-        len(example['chosen']) <= 2000 and
-        len(example['rejected']) <= 2000
-    )
-# トレーニングデータをフィルタリング
-filtered_train = ds['train'].filter(filter_short_examples)
-# データセットをトレーニング用と評価用に分割 (80%をトレーニング用、20%を評価用)
-train_size = int(0.8 * len(filtered_train))  # トレーニングデータのサイズ
-eval_size = len(filtered_train) - train_size  # 評価データのサイズ
-# インデックスを順序通りに生成 (ランダム性なし)
-train_indices = list(range(train_size))  # トレーニング用インデックス
-eval_indices = list(range(train_size, len(filtered_train)))  # 評価用インデックス
-# トレーニングデータと評価データを選択
-train_dataset = filtered_train.select(train_indices)
-eval_dataset = filtered_train.select(eval_indices)
-# データセットのサイズを出力
-print(f"トレーニングデータセットのサイズ: {len(train_dataset)}")
-print(f"評価データセットのサイズ: {len(eval_dataset)}")
-use_dataset = train_dataset.select(range(100))
-use_dataset
-# One must patch the DPO Trainer first!
-from unsloth import PatchDPOTrainer
-PatchDPOTrainer()
-from transformers import TrainingArguments
-from trl import DPOTrainer, DPOConfig
-from unsloth import is_bfloat16_supported
-dpo_trainer = DPOTrainer(
-    model = model,
-    ref_model = None,
-    args = DPOConfig(
-        per_device_train_batch_size = 2,
-        gradient_accumulation_steps = 4,
-        warmup_ratio = 0.1,
-        num_train_epochs = 1,
-        learning_rate = 5e-6,
-        fp16 = not is_bfloat16_supported(),
-        bf16 = is_bfloat16_supported(),
-        logging_steps = 1,
-        optim = "adamw_8bit",
-        weight_decay = 0.0,
-        lr_scheduler_type = "linear",
-        seed = 42,
-        output_dir = "outputs",
-        report_to = "none", # Use this for WandB etc
-    ),
-    beta = 0.1,
-    train_dataset = use_dataset, #raw_datasets["train"],
-    # eval_dataset = raw_datasets["test"],
-    tokenizer = tokenizer,
-    max_length = 2048,
-    max_prompt_length = 1024,
-)
-dpo_trainer.train()
-# ELYZA-tasks-100-TVの読み込み。
-import json
 datasets = []
 with open("/content/elyza-tasks-100-TV_0.jsonl", "r") as f:
     item = ""
     for line in f:
-      line = line.strip()
-      item += line
-      if item.endswith("}"):
-        datasets.append(json.loads(item))
-        item = ""
-# 学習したモデルを用いてタスクを実行
-from tqdm import tqdm
-# 推論するためにモデルのモードを変更
-FastLanguageModel.for_inference(model)
 results = []
 for dt in tqdm(datasets):
-  input = dt["input"]
-  prompt = f"""### 指示\n{input}\n### 回答\n"""
-  inputs = tokenizer([prompt], return_tensors = "pt").to(model.device)
-  outputs = model.generate(**inputs, max_new_tokens = 2048, use_cache = True, do_sample=False, repetition_penalty=1.2)
-  prediction = tokenizer.decode(outputs[0], skip_special_tokens=True).split('\n### 回答')[-1]
-  results.append({"task_id": dt["task_id"], "input": input, "output": prediction})
-#modelをhugging faceにアップロード
-# LoRAアダプタだけ保存
-model.push_to_hub_merged(
-    "llm-jp-3-13b-finetune-241202_lora-DPO-12-17",#保存するモデルの名前
-    tokenizer=tokenizer,
-    save_method="lora",#loraだけ保存
-    token=HF_TOKEN,
-    private=True
-)

 - en
 ---
+## 概要
+[llm-jp/llm-jp-3-13b](https://huggingface.co/llm-jp/llm-jp-3-13b) をベースに、LoRA（Low-Rank Adaptation）を用いたモデルである[Toki-AI/llm-jp-3-13b-finetune-241202](https://huggingface.co/Toki-AI/llm-jp-3-13b-finetune-241202)に対して、DPOを適用したモデルである。
+- **Developed by:** Toki-AI
+- **License:** apache-2.0
+- **Finetuned from model:** [llm-jp/llm-jp-3-13b](https://huggingface.co/llm-jp/llm-jp-3-13b)
 [<img src="https://raw.githubusercontent.com/unslothai/unsloth/main/images/unsloth%20made%20with%20love.png" width="200"/>](https://github.com/unslothai/unsloth)
+## 使用データセット
+- [weblab-GENIAC/aya-ja-nemotron-dpo-masked](https://huggingface.co/datasets/weblab-GENIAC/aya-ja-nemotron-dpo-masked)
+## 推論環境の準備
+以下のようにライブラリをインストールしてください（環境によっては適宜調整）。
+```bash
+pip install transformers
+pip install datasets
+pip install accelerate
+pip install trl
+pip install peft
+pip install bitsandbytes   # 4bit量子化利用時など、GPUに応じて追加でインストール
+```
+`!pip list` などで依存パッケージが正しくインストールされているかを確認しておきます。
+```bash
 !pip list
+```
+## 推論方法
+### 1. モデルのロード
+```python
 from unsloth import FastLanguageModel
 import torch
+max_seq_length = 2048  # 推論時に使用する最大シーケンス長
+dtype = None           # Noneで自動検出 (Tesla T4, V100ならfp16、Ampere+ならbfloat16)
+load_in_4bit = True    # メモリ削減のため4bit量子化を使用
+HF_TOKEN = "your_token"
 model, tokenizer = FastLanguageModel.from_pretrained(
+    model_name = "Toki-AI/llm-jp-3-13b-finetune-241202",
     max_seq_length = max_seq_length,
     dtype = dtype,
     load_in_4bit = load_in_4bit,
+    token = HF_TOKEN
 )
+```
+### 2. Hugging Face Hubへのログイン
+```python
+from huggingface_hub import login
+login(HF_TOKEN)  # Hugging Faceのアクセストークンを入力
+```
+### 3. 推論実行例 (ELYZA-tasks-100-TV)
+以下は `elyza-tasks-100-TV_0.jsonl` のタスクに対して推論を行い、回答を取得する例です。
+```python
+import json
+from tqdm import tqdm
+from unsloth import FastLanguageModel
+# 推論のためにモデルのモードを切り替え
+FastLanguageModel.for_inference(model)
+# JSONLファイルの読み込み
 datasets = []
 with open("/content/elyza-tasks-100-TV_0.jsonl", "r") as f:
     item = ""
     for line in f:
+        line = line.strip()
+        item += line
+        if item.endswith("}"):
+            datasets.append(json.loads(item))
+            item = ""
 results = []
 for dt in tqdm(datasets):
+    input_text = dt["input"]
+    prompt = f"""### 指示\n{input_text}\n### 回答\n"""
+    # トークナイズ & 推論
+    inputs = tokenizer([prompt], return_tensors="pt").to(model.device)
+    outputs = model.generate(
+        **inputs,
+        max_new_tokens=2048,
+        use_cache=True,
+        do_sample=False,
+        repetition_penalty=1.2
+    )
+    prediction = tokenizer.decode(outputs[0], skip_special_tokens=True).split('\n### 回答')[-1]
+    results.append({
+        "task_id": dt["task_id"],
+        "input": input_text,
+        "output": prediction
+    })
+# 結果を確認
+for r in results[:3]:
+    print(r)
+```
+本サンプルコードでは `repetition_penalty=1.2` を指定していますが、各種パラメータは用途に応じて変更してください (例: `temperature`, `top_p`, `max_new_tokens` など)。
+## ライセンス
+本モデルは [Apache License 2.0](./LICENSE) のもとで配布されています。
+ベースモデルである [llm-jp/llm-jp-3-13b](https://huggingface.co/llm-jp/llm-jp-3-13b) のライセンスおよび利用規約もあわせてご確認ください。
+本モデルの利用にあたっては、各種規約を遵守してください。
+---