PaLI-X

  • PaLI-X: On Scaling up a Multilingual Vision and Language Model [167.0]
    マルチ言語ビジョンと言語モデルであるPaLI-Xをスケールアップする際のトレーニングレシピと結果を示す。 我々のモデルは、多種多様な複雑なタスクにおいて、新しいレベルのパフォーマンスを達成する。 複雑なカウントや多言語オブジェクト検出といった,トレーニングミックスに明示的に含まれないタスクの出現を観察する。
    論文  参考訳(メタデータ)   (Mon, 29 May 2023 18:58:38 GMT)
  • PaLI: Pathways Language and Image – arXiv最新論文の紹介 (devneko.jp)の新バージョン(?)、Vision-Languageなタスクで優れた性能を達成
  • モデルアーキテクチャはViT 22B + UL2 32B?

Vision-Language Intelligenceのサーベイ

  • Vision-Language Intelligence: Tasks, Representation Learning, and Large Models [32.1]
    本稿では,時間的観点からの視覚言語知能の包括的調査について述べる。 本稿では,この分野での開発を,タスク固有手法,視覚言語事前学習法,大規模弱ラベルデータによって強化された大規模モデルという3つの期間にまとめる。
    論文  参考訳(メタデータ)   (Thu, 3 Mar 2022 18:54:59 GMT)
    • Vision-Languageな研究の流れが分かるサーベイ。であると同時に特に最近は月単位で新たな手法が提案されていることが分かる。

Visual Parsing with Self-Attention for Vision-Language Pre-training

  • Probing Inter-modality: Visual Parsing with Self-Attention for Vision-Language Pre-training [139.5]
    Vision-Language Pre-Trainingは、画像とテキストのペアからマルチモーダル表現を学ぶことを目的としている。 CNNは、長距離依存をモデル化する際の局所受容野の弱点により、視覚的関係学習に制限がある。 本研究では,視覚関係をよりよく学習し,モーダル間アライメントを促進するために,VLPのためのフルトランスフォーマー視覚埋め込みを提案する。。
    論文  参考訳(メタデータ)   (Mon, 28 Jun 2021 04:42:48 GMT)
    • マルチモーダルな事前学習モデルのため画像認識部分にもself-attentionを導入、MLM(Masked Language Modeling)、ITM(Image- Text Matching)、MFR(Masked Feature Regression)を活用してモデルを構築し、UNITERSOHOを上回る性能を出したとのこと。