arXiv – ページ 263 – arXiv最新論文の紹介

SimpleBERT: テキスト簡略化のための事前学習

SimpleBERT: A Pre-trained Model That Learns to Generate Simple Words [59.1]
本研究では,テキストの簡易化を継続する事前学習手法を提案する。我々は、継続事前学習に小規模な単純なテキストデータセットを使用し、簡単な単語を識別するために2つの方法を用いる。語彙単純化タスクと文簡略化タスクの両方においてBERTを超えるSimpleBERTを得る。
論文参考訳（メタデータ）参考訳（全文） (Sat, 16 Apr 2022 11:28:01 GMT)
- 単語をランダムにマスクするのではなく、単純な単語だけをマスクする方針で事前学習をしたBERTが通常のBERTよりテキスト簡略化タスクで有効だったという報告。
- 事前学習の戦略の工夫で最終的な性能が上がるのは直感的にもそうだと思うし実用でも研究でも重要な視点。

OTExtSum(Optimal Transport Extractive Summariser): 最適輸送を利用した文書要約

OTExtSum: Extractive Text Summarisation with Optimal Transport [45.8]
テキスト要約を最適輸送(OT)問題として初めて定式化した非学習型手法を提案する。提案手法は,最先端の非学習的手法と最近の学習的手法をROUGEメートル法で比較した。
論文参考訳（メタデータ）参考訳（全文） (Thu, 21 Apr 2022 13:25:34 GMT)
- 最適輸送によるテキスト要約。MultinewsやPubmedではUnsupervisedな手法として優れた性能。ただ、CNNDMでは十分な性能になっておらず文書の長さによるものではないかとしている。
- リポジトリはGitHub – peggypytang/OTExtSum: This code is for paper “OTExtSum: Extractive Text Summarisation with Optimal Transport”, Findings of NAACL 2022

SNP2Vec: Single Nucleotide Polymorphisms 2 Vec

SNP2Vec: Scalable Self-Supervised Pre-Training for Genome-Wide Association Study [48.8]
SNP2Vecは、SNPを理解するためのスケーラブルな自己教師付き事前学習手法である。本研究では,SNP2Vecを用いて時系列ゲノミクスモデリングを行う。中国コホートにおけるアルツハイマー病のリスク予測におけるアプローチの有効性について検討した。
論文参考訳（メタデータ）参考訳（全文） (Thu, 14 Apr 2022 01:53:58 GMT)
- このような分野にも2vecシリーズが・・・

アノテーションの品質

Re-Examining Human Annotations for Interpretable NLP [80.8]
我々は、Interpretable NLPで広く使われている2つのデータセット上で、クラウドソースのウェブサイトを用いて制御実験を行う。我々は,異なる資格レベルを満たす人材の募集から得られた注釈結果を比較した。以上の結果から,アノテーションの品質は労働者の資格に高い影響を受けており,労働者は指示によって特定のアノテーションを提供するように指導することができることがわかった。
論文参考訳（メタデータ）参考訳（全文） (Sun, 10 Apr 2022 02:27:30 GMT)
- アノテータによってアノテーションの品質が大きく変わるなどアノテーションに関する包括的な報告。「Surprisingly, providing example annotations does not increase the agreement among annotators.」など非常に参考になる。

GRAPHELSUMS(summaries with graphical elements): グラフィカルな要約データセット

Summarization with Graphical Elements [55.6]
本稿では,グラフィカル要素による要約という新しい課題を提案する。タスクの研究を支援するために,高品質なラベル付きデータセットを収集する。
論文参考訳（メタデータ） (Fri, 15 Apr 2022 17:16:41 GMT)
- ナレッジグラフのような形で要約する新しい要約タスクの提案とデータセット、ベースモデルの提示。提案されたデータセットでは関係として「L = {who, what, what happens, what happened, what will happen, where, when, why}」が与えられており、このような関係で結ばれた小さな要約で構成されていると確かに読みやすい。
- リポジトリはhttps://github.com/maartjeth/summarization_with_graphical_elementsとのことだが現時点では404

法的判断予測のサーベイ

A Survey on Legal Judgment Prediction: Datasets, Metrics, Models and Challenges [73.3]
法定判断予測(LJP)は,事実記述に基づく判断結果の自動予測に自然言語処理(NLP)技術を適用している。 6言語で31のLJPデータセットを分析し、その構築過程を示し、LJPの分類方法を定義する。異なる訴訟の8つの代表的データセットに対する最先端の結果を示し、オープンな課題について議論する。
論文参考訳（メタデータ） (Mon, 11 Apr 2022 04:06:28 GMT)
- 法的な判断への自然言語処理技術適用のサーベイ。近年トップカンファレスでの発表が増えている事、多種多様なアプローチがあることも分かる。解釈可能性の重視などクリティカルな領域への自然言語処理技術適用の話としても興味深い。

ViViD++: Vision for Visibility Dataset

ViViD++: Vision for Visibility Dataset [14.8]
様々な輝度条件をターゲットとした多様な視覚データフォーマットを抽出したデータセットを提案する。代替センサーの可能性にもかかわらず、代替視覚センサーを備えたデータセットは依然として少ない。これらの測定結果と慣性センサーと接地構造を併用して,照明不良下でのロバストな視力SLAMを開発する。
論文参考訳（メタデータ） (Thu, 14 Apr 2022 00:38:12 GMT)
- 様々な種類のセンサーを含むデータセット。ただし「Please note that only education domains (.edu, *.ac. etc.) are allowed for download.」とのこと
- プロジェクトサイトはViViD++ · Vision for Visibility Dataset

NTED(Neural Texture Extraction and Distribution): 制御可能な人物画像生成

Neural Texture Extraction and Distribution for Controllable Person Image Synthesis [46.6]
身体のポーズや外観を明示的に制御した参照画像から人間を再レンダリングすることを目的とした、制御可能な人物画像合成タスクに対処する。人物画像が高度に構造化されていることを観察し、参照画像のセマンティックエンティティを抽出し、分散することにより、所望の画像を生成することを提案する。
論文参考訳（メタデータ）参考訳（全文） (Wed, 13 Apr 2022 03:51:07 GMT)
- 参照画像をもとに一定の制御（ポーズの変更など）を加えた人物画像を生成する研究。非常にクオリティが高い。
- リポジトリはGitHub – RenYurui/Neural-Texture-Extraction-Distribution

CsaNMT: Continuous Semantic Augmentationを用いたニューラル機械翻訳

Learning to Generalize to More: Continuous Semantic Augmentation for Neural Machine Translation [50.5]
CsaNMT(Continuous Semantic Augmentation)と呼ばれる新しいデータ拡張パラダイムを提案する。 CsaNMTは各トレーニングインスタンスを、同じ意味の下で適切なリテラル式をカバーできる隣接領域で拡張する。
論文参考訳（メタデータ） (Thu, 14 Apr 2022 08:16:28 GMT)
- データ拡張によって優れた性能を発揮する手法の提案。BackTranslationを大きく上回っている（がモノリンガルデータは導入していない？）。データ拡張系手法の中でSoTAを主張。
- GitHub – pemywei/csanmt: This is a code repository for the ACL 2022 paper “Learning to Generalize to More: Continuous Semantic Augmentation for Neural Machine Translation”

FactGraph: 要約における事実性の評価

FactGraph: Evaluating Factuality in Summarization with Semantic Graph Representations [114.9]
文書と要約を構造化された意味表現(MR)に分解するFactGraphを提案する。 MRは、コアセマンティックの概念とその関係を記述し、文書と要約の両方の主要な内容を標準形式で集約し、データの疎結合を減少させる。事実性を評価するための異なるベンチマークの実験では、FactGraphは以前のアプローチよりも最大15%優れていた。
論文参考訳（メタデータ） (Wed, 13 Apr 2022 16:45:33 GMT)
- 文書と要約で意味的整合性が取れないことがあるが、その評価を行う研究。グラフベースのアプローチを用いることでQAベースの手法よりも優れた結果であったとのこと。
- コードはhttps://github.com/amazon-research/fact-graphで公開予定

2026年7月
月	火	水	木	金	土	日
		1	2	3	4	5
6	7	8	9	10	11	12
13	14	15	16	17	18	19
20	21	22	23	24	25	26
27	28	29	30	31