add development files

Browse files

Files changed (3) hide show

DPO.py +134 -0
LoRa.py +259 -0
LoRa_inference.py +86 -0

DPO.py ADDED Viewed

	@@ -0,0 +1,134 @@

+import json
+import os
+from unsloth import FastLanguageModel
+from datasets import Dataset
+from trl import DPOTrainer, DPOConfig
+import torch
+# Model loading function
+def load_model():
+    print("Initializing model loading...")
+    model_name = "outputs_sample_code/checkpoint-200"
+    max_seq_length = 512
+    model, tokenizer = FastLanguageModel.from_pretrained(
+        model_name,
+        dtype=None,
+        load_in_4bit=True
+    )
+    print("Model and tokenizer loaded successfully.")
+    print(f"Model type: {type(model)}, Tokenizer type: {type(tokenizer)}")
+    if hasattr(model, 'config'):
+        print("Setting max_seq_length in model.config")
+        model.config.max_seq_length = max_seq_length
+    else:
+        print("Error: model.config does not exist!")
+    model = FastLanguageModel.get_peft_model(
+        model,
+        r=32,
+        target_modules=["q_proj", "k_proj", "v_proj", "o_proj", "gate_proj", "up_proj", "down_proj"],
+        lora_alpha=32,
+        lora_dropout=0.05,
+        bias="none",
+        use_gradient_checkpointing="unsloth",
+        random_state=3407,
+        use_rslora=False,
+        loftq_config=None,
+        max_seq_length=max_seq_length
+    )
+    print("PEFT model configured.")
+    return model, tokenizer
+# Dataset loading function
+def load_dataset():
+    print("Loading dataset...")
+    dataset_name = "cyberagent/chatbot-arena-ja-calm2-7b-chat-experimental"
+    from datasets import load_dataset
+    dataset = load_dataset(dataset_name)
+    formatted_data = []
+    for item in dataset["train"]:
+        formatted_data.append({
+            "prompt": item.get("prompt", ""),
+            "chosen": item.get("response_winner", ""),
+            "rejected": item.get("response_loser", "")
+        })
+    print(f"Formatted data: {len(formatted_data)} items")
+    return Dataset.from_dict({
+        "prompt": [item["prompt"] for item in formatted_data],
+        "chosen": [item["chosen"] for item in formatted_data],
+        "rejected": [item["rejected"] for item in formatted_data]
+    })
+# DPO training function
+def train_dpo(model, tokenizer, dataset):
+    print("Configuring training arguments...")
+    training_args = DPOConfig(
+        output_dir="./dpo_trained_model_1216",
+        overwrite_output_dir=True,
+        per_device_train_batch_size=8,
+        gradient_accumulation_steps=128,
+        per_device_eval_batch_size=8,
+        learning_rate=1e-5,
+        weight_decay=0.01,
+        num_train_epochs=1,
+        lr_scheduler_type="constant_with_warmup",
+        warmup_steps=10,
+        fp16=True,
+        eval_strategy="steps",
+        save_strategy="steps",
+        save_steps=32,
+        logging_steps=8,
+        eval_steps=8,
+        load_best_model_at_end=True,
+        save_safetensors=False,
+        save_only_model=True,
+        remove_unused_columns=False,
+    )
+    print("Training arguments configured.")
+    print("Initializing DPOTrainer...")
+    dpo_trainer = DPOTrainer(
+        model=model,
+        args=training_args,
+        beta=0.3,
+        train_dataset=dataset,
+        eval_dataset=dataset,
+        tokenizer=tokenizer,
+        max_prompt_length=162,
+        max_length=512,
+        loss_type="sigmoid",
+        label_smoothing=0.0,
+    )
+    print("DPOTrainer initialized.")
+    print("Starting training...")
+    original_forward = model.forward
+    def new_forward(*args, **kwargs):
+        if "input_ids" in kwargs:
+            kwargs["input_ids"] = kwargs["input_ids"].long()
+        return original_forward(*args, **kwargs)
+    model.forward = new_forward
+    dpo_trainer.train()
+    print("Training completed.")
+if __name__ == "__main__":
+    print("Loading model...")
+    model, tokenizer = load_model()
+    print("Loading dataset...")
+    dataset = load_dataset()
+    print("Starting DPO training...")
+    train_dpo(model, tokenizer, dataset)
+    print("Training complete. Model saved.")

LoRa.py ADDED Viewed

	@@ -0,0 +1,259 @@

+# llm-jp/llm-jp-3-13bを4bit量子化のqLoRA設定でロード。
+from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
+from unsloth import FastLanguageModel
+import torch
+max_seq_length = 512 # unslothではRoPEをサポートしているのでコンテキスト長は自由に設定可能
+dtype = None # Noneにしておけば自動で設定
+load_in_4bit = True # 今回は8Bクラスのモデルを扱うためTrue
+model_id = "llm-jp/llm-jp-3-13b"
+new_model_id = "llm-jp-3-13b-finetune-2" #Fine-Tuningしたモデルにつけたい名前
+# FastLanguageModel インスタンスを作成
+model, tokenizer = FastLanguageModel.from_pretrained(
+    model_name=model_id,
+    dtype=dtype,
+    load_in_4bit=load_in_4bit,
+    trust_remote_code=True,
+)
+# SFT用のモデルを用意
+model = FastLanguageModel.get_peft_model(
+    model,
+    r = 32,
+    target_modules = ["q_proj", "k_proj", "v_proj", "o_proj",
+                      "gate_proj", "up_proj", "down_proj",],
+    lora_alpha = 32,
+    lora_dropout = 0.05,
+    bias = "none",
+    use_gradient_checkpointing = "unsloth",
+    random_state = 3407,
+    use_rslora = False,
+    loftq_config = None,
+    max_seq_length = max_seq_length,
+)
+# Hugging Face Token を指定
+# 下記の URL から Hugging Face Token を取得できますので下記の HF_TOKEN に入れてください。
+# https://huggingface.co/settings/tokens
+HF_TOKEN = "" #@param {type:"string"}
+# あるいは Google Colab シークレットを使う場合、左のサイドバーより🔑マークをクリック
+# HF_TOKEN という名前で Value に Hugging Face Token を入れてください。
+# ノートブックからのアクセスのトグルをオンにし、下記の二行のコードのコメントアウトを外してください。
+# from google.colab import userdata
+# HF_TOKEN=userdata.get('HF_TOKEN')
+"""=============="""
+# 学習に用いるデータセットの指定
+# 今回はLLM-jp の公開している Ichikara Instruction を使います。データにアクセスするためには申請が必要ですので、使いたい方のみ申請をしてください。
+# Ichikara Instruciton を Hugging Face Hub にて公開することはお控えください。
+# 下記のリンクから申請を終えた先に Google Drive があり、Distribution20241221_all というフォルダごとダウンロードしてください。
+# 今回は「ichikara-instruction-003-001-1.json」を使います。必要であれば展開（!unzip など）し、データセットのパスを適切に指定してください。
+# omnicampusの開発環境では取得したデータを左側にドラッグアンドドロップしてお使いください。
+# Google Colab の場合も左のサイドバーよりドラッグ&ドロップでアップデートしてください。
+# https://liat-aip.sakura.ne.jp/wp/llmのための日本語インストラクションデータ作成/llmのための日本語インストラクションデータ-公開/
+# 関根聡, 安藤まや, 後藤美知子, 鈴木久美, 河原大輔, 井之上直也, 乾健太郎. ichikara-instruction: LLMのための日本語インストラクションデータの構築. 言語処理学会第30回年次大会(2024)
+from datasets import load_dataset
+dataset = load_dataset("json", data_files="Distribution20241221_all/Distribution20241221_all/ichikara-instruction-003-001-1.json")
+# パスの指定にご注意ください。アップロードしたファイルを右クリックし、「パスをコピー」をクリック、上記の data_files と合致していることをご確認ください。Omnicampus のディレクトリ構造とは異なるかもしれません。
+# 学習時のプロンプトフォーマットの定義
+prompt = """### 指示
+{}
+### 回答
+{}"""
+"""
+formatting_prompts_func: 各データをプロンプトに合わせた形式に合わせる
+"""
+EOS_TOKEN = tokenizer.eos_token # トークナイザーのEOSトークン（文末トークン）
+def formatting_prompts_func(examples):
+    input = examples["text"] # 入力データ
+    output = examples["output"] # 出力データ
+    text = prompt.format(input, output) + EOS_TOKEN # プロンプトの作成
+    return { "formatted_text" : text, } # 新しいフィールド "formatted_text" を返す
+pass
+# # 各データにフォーマットを適用
+dataset = dataset.map(
+    formatting_prompts_func,
+    num_proc= 4, # 並列処理数を指定
+)
+print(dataset)
+# データを確認
+print(dataset["train"]["formatted_text"][3])
+"""
+training_arguments: 学習の設定
+  - output_dir:
+      -トレーニング後のモデルを保存するディレクトリ
+  - per_device_train_batch_size:
+      - デバイスごとのトレーニングバッチサイズ
+  - per_device_eval_batch_size:
+      - デバイスごとの評価バッチサイズ
+  - gradient_accumulation_steps:
+      - 勾配を更新する前にステップを積み��ねる回数
+  - optim:
+      - オプティマイザの設定
+  - num_train_epochs:
+      - エポック数
+  - eval_strategy:
+      - 評価の戦略 ("no"/"steps"/"epoch")
+  - eval_steps:
+      - eval_strategyが"steps"のとき、評価を行うstep間隔
+  - logging_strategy:
+      - ログ記録の戦略
+  - logging_steps:
+      - ログを出力するステップ間隔
+  - warmup_steps:
+      - 学習率のウォームアップステップ数
+  - save_steps:
+      - モデルを保存するステップ間隔
+  - save_total_limit:
+      - 保存しておくcheckpointの数
+  - max_steps:
+      - トレーニングの最大ステップ数
+  - learning_rate:
+      - 学習率
+  - fp16:
+      - 16bit浮動小数点の使用設定（第8回演習を参考にすると良いです）
+  - bf16:
+      - BFloat16の使用設定
+  - group_by_length:
+      -  入力シーケンスの長さによりバッチをグループ化 (トレーニングの効率化)
+  - report_to:
+      - ログの送信先 ("wandb"/"tensorboard"など)
+"""
+from trl import SFTTrainer
+from transformers import TrainingArguments
+from unsloth import is_bfloat16_supported
+trainer = SFTTrainer(
+    model = model,
+    tokenizer = tokenizer,
+    train_dataset=dataset["train"],
+    max_seq_length = max_seq_length,
+    dataset_text_field="formatted_text",
+    packing = False,
+    args = TrainingArguments(
+        per_device_train_batch_size = 2,
+        gradient_accumulation_steps = 4,
+        num_train_epochs = 1,
+        logging_steps = 10,
+        warmup_steps = 10,
+        save_steps=100,
+        save_total_limit=2,
+        max_steps=-1,
+        learning_rate = 2e-4,
+        fp16 = not is_bfloat16_supported(),
+        bf16 = is_bfloat16_supported(),
+        group_by_length=True,
+        seed = 3407,
+        output_dir = "outputs",
+        report_to = "none",
+    ),
+)
+#@title 現在のメモリ使用量を表示
+gpu_stats = torch.cuda.get_device_properties(0)
+start_gpu_memory = round(torch.cuda.max_memory_reserved() / 1024 / 1024 / 1024, 3)
+max_memory = round(gpu_stats.total_memory / 1024 / 1024 / 1024, 3)
+print(f"GPU = {gpu_stats.name}. Max memory = {max_memory} GB.")
+print(f"{start_gpu_memory} GB of memory reserved.")
+#@title 学習実行
+trainer_stats = trainer.train()
+# ELYZA-tasks-100-TVの読み込み。事前にファイルをアップロードしてください
+# データセットの読み込み。
+# omnicampusの開発環境では、左にタスクのjsonlをドラッグアンドドロップしてから実行。
+import json
+datasets = []
+with open("./elyza-tasks-100-TV_0.jsonl", "r") as f:
+    item = ""
+    for line in f:
+      line = line.strip()
+      item += line
+      if item.endswith("}"):
+        datasets.append(json.loads(item))
+        item = ""
+# 学習したモデルを用いてタスクを実行
+from tqdm import tqdm
+# 推論するためにモデルのモードを変更
+FastLanguageModel.for_inference(model)
+results = []
+for dt in tqdm(datasets):
+  input = dt["input"]
+  prompt = f"""### 指示\n{input}\n### 回答\n"""
+  # prompt = f"""### 質問\n{input}\n### 回答\n"""
+  inputs = tokenizer([prompt], return_tensors = "pt").to(model.device)
+  outputs = model.generate(**inputs, max_new_tokens = 512, use_cache = True, do_sample=False, repetition_penalty=1.2)
+  prediction = tokenizer.decode(outputs[0], skip_special_tokens=True).split('\n### 回答')[-1]
+  results.append({"task_id": dt["task_id"], "input": input, "output": prediction})
+  # jsonlで保存
+with open(f"{new_model_id}_output.jsonl", 'w', encoding='utf-8') as f:
+    for result in results:
+        json.dump(result, f, ensure_ascii=False)
+        f.write('\n')
+# モデルとトークナイザーをHugging Faceにアップロード。
+# 一旦privateでアップロードしてください。
+# 最終成果物が決まったらpublicにするようお願いします。
+# 現在公開しているModel_Inference_Template.ipynbはunslothを想定していないためそのままでは動かない可能性があります。
+HF_WRITE_TOKEN = "" #@param {type:"string"}
+model.push_to_hub_merged(
+    new_model_id,
+    tokenizer=tokenizer,
+    save_method="lora",
+    token=HF_WRITE_TOKEN,
+    private=True
+)
+# model.push_to_hub(new_model_id, token=HF_TOKEN, private=True) # Online saving
+# tokenizer.push_to_hub(new_model_id, token=HF_TOKEN) # Online saving

LoRa_inference.py ADDED Viewed

	@@ -0,0 +1,86 @@

+# 必要なライブラリを読み込み
+# LoRa_inference.py
+import sys
+from unsloth import FastLanguageModel
+from peft import PeftModel
+import torch
+import json
+from tqdm import tqdm
+import re
+# ベースとなるモデルと学習したLoRAのアダプタ（Hugging FaceのIDを指定）。
+model_id = "llm-jp/llm-jp-3-13b"
+adapter_id = "outputs/checkpoint-200/"
+adapter_id = "final_model_reversed_model/"
+adapter_id = "outputs_add_learning_without/checkpoint-363"
+adapter_id = "outputs_sample_code/checkpoint-200"
+adapter_id = "outputs/checkpoint-363"
+adapter_id = "sft_outputs/checkpoint-1600"
+adapter_id = "dpo_trained_model_1215/checkpoint-14"
+model_id = adapter_id
+# Hugging Face Token を指定。
+# 下記の URL から Hugging Face Token を取得できますので下記の HF_TOKEN に入れてください。
+HF_TOKEN = "" #@param {type:"string"}
+# unslothのFastLanguageModelで元のモデルをロード。
+dtype = None # Noneにしておけば自動で設定
+load_in_4bit = True # 今回は13Bモデルを扱うためTrue
+model, tokenizer = FastLanguageModel.from_pretrained(
+    model_name=model_id,
+    dtype=dtype,
+    load_in_4bit=load_in_4bit,
+    trust_remote_code=True,
+)
+# タスクとなるデータの読み込み。
+# 事前にデータをアップロードしてください。
+datasets = []
+with open("./elyza-tasks-100-TV_0.jsonl", "r") as f:
+    item = ""
+    for line in f:
+      line = line.strip()
+      item += line
+      if item.endswith("}"):
+        datasets.append(json.loads(item))
+        item = ""
+# モデルを用いてタスクの推論。
+# 推論するためにモデルのモードを変更
+FastLanguageModel.for_inference(model)
+results = []
+for dt in tqdm(datasets):
+  input = dt["input"]
+  #prompt = f"""### 指示\n{input}\n### 回答\n"""
+  prompt = f"""### 指示\n{input}\n より忍耐強く、より詳細で理解しやすいステップで、回答全体を書き直して。\n### 回答\n"""
+  # prompt = f"""### 質問\n{input}\n### 回答\n"""
+  inputs = tokenizer([prompt], return_tensors = "pt").to(model.device)
+  #print(inputs)
+  #sys.exit()
+  outputs = model.generate(**inputs, max_new_tokens = 512, use_cache = True, do_sample=False, repetition_penalty=1.2)
+  prediction = tokenizer.decode(outputs[0], skip_special_tokens=True).split('\n### 回答')[-1]
+  results.append({"task_id": dt["task_id"], "input": input, "output": prediction})
+# 結果をjsonlで保存。
+# ここではadapter_idを元にファイル名を決定しているが、ファイル名は任意で問題なし。
+# json_file_id = re.sub(r".*/", "", adapter_id)
+json_file_id = adapter_id
+with open(f"{json_file_id}_output.jsonl", 'w', encoding='utf-8') as f:
+    for result in results:
+        json.dump(result, f, ensure_ascii=False)
+        f.write('\n')