arXiv最新論文の紹介

CLIcK: Cultural and Linguistic Intelligence in Korean

CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean [19.6]
韓国における1,995対のQAペアからなる文化・言語知能のベンチマークについて紹介する。 CLIcKは、公式の韓国の試験と教科書からデータを入手し、質問を言語と文化の2つの主要なカテゴリで11のカテゴリに分けている。 CLIcKを用いて、13の言語モデルを用いて、パフォーマンスを評価する。評価では、カテゴリ間でのパフォーマンスに関する洞察と、その理解に影響を与えるさまざまな要因を明らかにする。
論文参考訳（メタデータ） (Mon, 11 Mar 2024 03:54:33 GMT)
韓国の文化的・言語的理解を評価するデータセット、日本語版が必要そうに思う。
リポジトリはrladmstn1714/CLIcK: CLIcK: Evaluation of Cultural and Linguistic Intelligence in Korean (github.com)

CoT Genius

ChainLM: Empowering Large Language Models with Improved Chain-of-Thought Prompting [124.7]
CoT(Chain-of-Thought)のプロンプトにより,大規模言語モデル(LLM)の推論能力が向上する既存のCoTアプローチは通常、単純な推論タスクに重点を置いており、結果として低品質で一貫性のないCoTプロンプトをもたらす。優れたCoTプロンプトの自動生成のための新しいフレームワークであるCoTGeniusを紹介する。
論文参考訳（メタデータ） (Thu, 21 Mar 2024 11:34:26 GMT)
CoTプロンプト自動作成のためのフレームワークCoT Geniusとfine tuningしたモデルの提案。CoT Geniusは「CoTGenius is developed based on three major evolution strategies, i.e., complicate, diversify, and specify—alongside two filtering mechanisms: evolutionary success judgement and correctness verification.」と進化＋フィルタリングで構成されている。
リポジトリはRUCAIBox/ChainLM (github.com)

ChartThinker

ChartThinker: A Contextual Chain-of-Thought Approach to Optimized Chart Summarization [32.2]
本研究は,各チャートに包括的チャートキャプチャペアと微調整命令の大規模データセットを構築した。本稿では,思考の連鎖に基づいて深い分析を合成する,革新的なチャート要約手法であるChartThinkerを提案する。キュレートされたデータセットに基づいて、トレーニングされたモデルは、チャートの要約タスクにおいて、常に優れたパフォーマンスを示します。
論文参考訳（メタデータ） (Sun, 17 Mar 2024 14:49:09 GMT)
チャート要約データセットChart-Sum-QAとチャート要約のモデルChartThinkerの提案。OCR併用の方が性能が高いのが気になるのと、GPT-4Vのような最新モデルを使った場合の結果が知りたいところ。
リポジトリはAnonymized Repository – Anonymous GitHub (4open.science)

WorldGPT

WorldGPT: A Sora-Inspired Video AI Agent as Rich World Models from Text and Image Inputs [53.2]
本稿では、Soraにインスパイアされたマルチモーダル学習の力を活用して、熟練した世界モデルフレームワークを構築する革新的なビデオ生成AIエージェントを提案する。このフレームワークには、プロンプトエンハンサーとフルビデオ翻訳という2つの部分が含まれている。
論文参考訳（メタデータ） (Sun, 10 Mar 2024 16:09:02 GMT)
Prompt Enhancer + Key Frame Generator + Video Generator での動画生成フレームワーク。「This innovative approach enables the generation of captivating videos that encapsulate rich and realistic world models.」とあるが本当なんだろうか。。。

RAFT: Retrieval Augmented Fine Tuning

RAFT: Adapting Language Model to Domain Specific RAG [75.6]
本稿では、ドメイン内の「オープンブック」設定において、モデルが質問に答える能力を改善するためのトレーニングレシピであるRetrieval Augmented FineTuning(RAFT)を紹介する。 RAFTは、質問に答える助けとなる関連文書から、動詞の正しいシーケンスを引用することで、これを達成します。 RAFTは、PubMed、HotpotQA、Gorillaデータセット全体のモデルのパフォーマンスを一貫して改善する。
論文参考訳（メタデータ） (Fri, 15 Mar 2024 09:26:02 GMT)
RAGのためのfine tuning手法の提案、「RAFT is a training strategy designed to enhance the model’s performance in answering questions within a specific domain, in “open-book” settings.」
リポジトリはGitHub – ShishirPatil/gorilla: Gorilla: An API store for LLMs

PERL: Parameter Efficient Reinforcement Learning

PERL: Parameter Efficient Reinforcement Learning from Human Feedback [27.7]
RLHF(Reinforcement Learning from Human Feedback)は、大規模言語モデルと人間の好みを結びつける強力な手法であることが証明されている。本稿では,Huらによって導入されたLoRA(Lo-Rank Adaptation)のパラメータ効率向上手法を用いて,基礎となるモデルを学習するRLHFについて検討する。 PERLは従来のRLHF設定と同等に動作し、高速かつ少ないメモリでトレーニングを行う。
論文参考訳（メタデータ） (Fri, 15 Mar 2024 21:43:46 GMT)
LoRA(Lo-Rank Adaptation)＋Reinforcement Learning from Human Feedback (RLHF)、「Through extensive experiments on various datasets, we have shown that this method achieves comparable results to conventional RLHF, for which all the model parameters are tuned, while reducing memory usage by approx 50%, and speeding up the training by up to 90% for the Reward Model training, and more modest memory savings of 20%, and speed-up of 10% in the RL loop.」とのことで効果的のよう。広範な実験がされており非常に参考になる。
👍と👎で評価された「Taskmaster/TM-4-2024 at master · google-research-datasets/Taskmaster · GitHub」「Taskmaster/TM-3-2020 at master · google-research-datasets/Taskmaster · GitHub」という2つのデータセットが公開されている。

AI and Memory Wall

AI and Memory Wall [81.1]
メモリ帯域幅がデコーダモデルの主要なボトルネックとなることを示す。私たちは、このメモリ制限を克服するためのモデルアーキテクチャ、トレーニング、デプロイメント戦略の再設計を主張します。
論文参考訳（メタデータ） (Thu, 21 Mar 2024 04:31:59 GMT)
本当にメモリ制約きつすぎ・・・、BlackwellなどGPUアーキテクチャが進むと改善傾向ではあるが今回はやや反則感のある計算だし。。

USimAgent

USimAgent: Large Language Models for Simulating Search Users [33.2]
大規模言語モデル(LLM)は、人間レベルの知能をシミュレートする可能性を示している。本稿では,LLMに基づくユーザ検索行動シミュレータUSimAgentを紹介する。提案するシミュレータは,検索中のユーザのクエリ,クリック,停止をシミュレートし,完全な検索セッションを生成することができる。
論文参考訳（メタデータ） (Thu, 14 Mar 2024 07:40:54 GMT)
検索を模倣するAgentの提案
ぼちぼち検索エンジンをそのまま利用するよりも便利になりつつある気がする、、

Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding

Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding [49.9]
状態空間モデルMambaは、長周期モデリングからビデオモデリングへの成功を拡大する有望な特性を示している。我々は、マンバがビデオのモデリングにおいて様々な役割を担い、マンバが優位性を示す様々なタスクを調査しながら、包括的な研究を行う。実験の結果,ビデオ専用タスクとビデオ言語タスクの両方において,Mambaの強い可能性を示すとともに,有望な効率と性能のトレードオフを示すことができた。
論文参考訳（メタデータ） (Thu, 14 Mar 2024 17:57:07 GMT)
動画領域へのMambaの応用。「Our comprehensive evaluation of Mamba within the video understanding domain showcases its potential as a viable alternative to traditional transformers」と肯定的な結果。
リポジトリはOpenGVLab/video-mamba-suite (github.com)

EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models

EXAMS-V: A Multi-Discipline Multilingual Multimodal Exam Benchmark for Evaluating Vision Language Models [29.3]
EXAMS-Vは、視覚言語モデルを評価するための、新しい挑戦的なマルチディシプリルマルチモーダル多言語試験ベンチマークである。自然科学、社会科学、その他の雑学を対象とする20の学派にまたがる20,932の質問からなる。質問は7つの言語ファミリーから11の言語で行われます。
論文参考訳（メタデータ） (Fri, 15 Mar 2024 15:08:39 GMT)
MultimodalかつMultilingualなLLM評価用データセット。残念ながら日本語は入っていない。GPT-4はさすがに強く、Gemini Proが続く結果。GPT-4・Gemini ProともにOCR(Google Tesseract for OCR)＋画像キャプション（GPT-4V）を併用してAugmented LLMとして問題を解かせた方が性能が良いというのは面白い。視点が違うcall数が増えているからだろうか。
日本語の試験のライセンスが気になるところで、可能ならこの手のデータセットに統合していきたい。。。
リポジトリはGitHub – RocktimJyotiDas/EXAMS-V: A Multi-discipline Multilingual Multimodal Exam Benchmark

2025年7月
月	火	水	木	金	土	日
	1	2	3	4	5	6
7	8	9	10	11	12	13
14	15	16	17	18	19	20
21	22	23	24	25	26	27
28	29	30	31