JaFIn:日本語金融インストラクションデータセット

Abstract

大規模言語モデル(LLM)を含む言語モデルのドメイン適応は,言語モデルが普及するにつれて注目を集めている.本研究では,インストラクションチューニングによるドメイン適応が有効であることを示す.そのために,日本語金融インストラクションデータセットであるJaFInを提案する.JaFInは,日本政府のウェブサイトを含む複数のデータソースに基づいて手動で構築され,豊富な金融知識を含む.いくつかのLLMに対してJaFInを用いてインストラクションチューニング適用し,金融に特化したモデルが元のモデルよりも優れたドメイン適応性を持つことを示す.金融に特化したLLMは,定量的な日本の金融ベンチマークと定性的な応答比較を用いて評価され,元のモデルよりも性能が向上することを確認した.

BibTeX

@article{Tanabe-2024-jafin-nlc,
  jtitle = {{JaFIn:日本語金融インストラクションデータセット}},
  title = {{JaFIn: Japanese Financial Instruction Dataset}},
  jauthor = {田邉, 耕太 and 鈴木, 雅弘 and 坂地, 泰紀 and 野田, 五十樹},
  author = {Tanabe, Kota and Suzuki, Masahiro and Sakaji, Hiroki and Noda, Itsuki},
  jjournal = {信学技報},
  journal = {IEICE Tech. Rep.},
  volume = {124},
  number = {173},
  year = {2024},
  pages = {87-92},
}

Download .bib