2022年8月18日 – arXiv最新論文の紹介

Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model [98.0]
約1億のパラメータを持つプレーンビジョントランスフォーマーを利用して、リモートセンシングタスク用にカスタマイズされた大規模なビジョンモデルを提案する。具体的には、RS画像における大きな画像サイズと様々な向きのオブジェクトを扱うために、回転する様々なウィンドウアテンションを提案する。検出タスクの実験は、DOTA-V1.0データセット上で81.16%のmAPを達成したすべての最先端モデルよりも、我々のモデルの方が優れていることを示す。
論文参考訳（メタデータ） (Wed, 10 Aug 2022 09:31:40 GMT)
- Vitの活用事例であり、比較対象が多く参考になる。DOTA Benchmark (Object Detection In Aerial Images) | Papers With Codeなど多くのデータセットでSoTA。
- リポジトリはGitHub – ViTAE-Transformer/Remote-Sensing-RVSA: The official repo for the paper “Advancing Plain Vision Transformer Towards Remote Sensing Foundation Model”

3D Vision with Transformers: A Survey [114.9]
自然言語処理におけるトランスフォーマーアーキテクチャの成功は、コンピュータビジョン分野の注目を集めている。本稿では,異なる3次元視覚タスクのための100以上のトランスフォーマー手法の体系的,徹底的なレビューを行う。我々は3次元視覚におけるトランスフォーマー設計について議論し、様々な3次元表現でデータを処理できるようにする。
論文参考訳（メタデータ） (Mon, 8 Aug 2022 17:59:11 GMT)
- 3D処理でも非常に流行しているtransformerのサーベイ100以上の手法が調査対象とのことで非常に幅広い。
- プロジェクトサイトはGitHub – lahoud/3d-vision-transformers: A list of 3D computer vision papers with Transformers

日: 2022年8月18日