SparseGPT – arXiv最新論文の紹介

Massive Language Models Can Be Accurately Pruned in One-Shot [29.3]
大規模生成事前学習型トランスフォーマー(GPT)ファミリーモデルが1ショットで少なくとも50%の間隔で切断できることを初めて示す。これはSparseGPTと呼ばれる新しいプルーニング手法によって実現され、特に大規模GPTファミリーモデルにおいて効率的かつ正確に動作するように設計されている。
論文参考訳（メタデータ） (Mon, 2 Jan 2023 17:48:56 GMT)
one-shotなpruning手法の報告。OPTを対象にした実験では50％程度はあまり性能を落とさずにpruningできるよう。より大きなモデルのほうがスパース化しやすいという指摘も興味深い。

コメントを残す

コメントを残す コメントをキャンセル