1: 名無しのメタバースさん 0000/00/00(※) 00:00:00.00 ID:metaversesoku
うぉぉきたー!!!
— やまかず (@Yamkaz) February 25, 2023
Metaより新しい大規模言語モデル「LLaMa」が発表!
しかもオープンソース!!https://t.co/GtNKlIFziAhttps://t.co/SUHgaRmPpt
70億、130億、330億、650億パラメータのシリーズ。そしてなんと..1750億のGPT-3を130億のLLaMAの性能は超えてて最大モデルはChinchilla、PaLMと競合 pic.twitter.com/Je0cVoe0Lm
クリックして開いたWEBサイトが素人には意味不明でした•••
— tm (@lkMfQ28gVWddgYA) February 25, 2023
※: 本日のおすすめサイト記事一覧 0000/00/00(※) ID:metaversesoku
「13BサイズでもLLaMAはほとんどのベンチマークでGPT-3より性能が上」
— fruits (@lgcyfruits) February 25, 2023
わくわく https://t.co/9Fpbf52HTq
MetaAIの大規模言語モデルといえばOPTシリーズでしたが、LLaMaという新しいシリーズが出たようです。LLaMa-13B(130億パラメータ)でGPT-3(175億)を上回っているというのはすごいですね・・・ https://t.co/IzborR881e
— 庭師🌱 (@GardenPillars) February 25, 2023
— Hikaru Awaya (@awaya_HR) February 25, 2023
LLMがOSではなくて自然言語自体がOSでLLMは半導体のようなイメージになってきた https://t.co/tS5aqWMR8I
— nakamura (@nakamura_cll) February 25, 2023
キターーーーー!!! https://t.co/9aOGAsvToV
— ちきお (@mocchiky) February 25, 2023
俺たちのMetaがついに... https://t.co/cFd1NuINX6
— 高瀬 博道 (Takase Hiromichi) (@takasehiromichi) February 25, 2023
これwkwkすぎる https://t.co/4n3Bv8F82j
— taiyaki (@tr_taiyaki) February 25, 2023
4: 名無しのメタバースさん 0000/00/00(※) 00:00:00.00 ID:metaversesoku
Meta!? https://t.co/EW8Bemz1gC
— りすりす/TwoSquirrels 💤💤 🍀 🌙 🐙🔥 (@TwoSquirrels) February 25, 2023
新しい言語モデル: LLaMA論文ちょろっと読んだ
— 逆瀬川 (@gyakuse) February 24, 2023
ここがみんな知りたいところだろうが、学習にかかった時間とGPUは、A100 80GB VRAM x 2048 x 21日間。
GCPのA100(3.85ドル/hour)の金額をそのまま当てると仮に民間が同程度の言語モデルを作ろうとすると学習に5.4億円程度かかるhttps://t.co/CUo6Ln6mYa
それと、たぶん日本語はあまり使えない(C4からは非英語データが除外されていて、採用されたwikipediaデータセットの20の言語に入っていない)。ただMETA AI(FAIR)の論文の例に漏れず知見が細かく書かれているので最高。
— 逆瀬川 (@gyakuse) February 24, 2023
decoder-onlyのTransformerアーキテクチャであり、PaLMのようにReLUをSwiGLUに置き換えている。またGPT-NeoXのように位置埋め込みにRoPEを使っている。学習の最適化にxformersを用いていてmemory_efficient_attentionは画像生成界隈にとっては馴染み深い
— 逆瀬川 (@gyakuse) February 24, 2023
その後にColumnParallelLinearとして呼んでいるfairscale ( https://t.co/tw2fINGubQ ) の話が出てくるんだけどそもそもfairscaleあんまわからん。詳しくは実装読んだほうが早い。fairscale使ってたりするところ以外は普通の実装。https://t.co/YALnaCKEU6
— 逆瀬川 (@gyakuse) February 24, 2023
Natural Questionsの0-shot性能がエグい。ただし、WikipediaベースのQA datasetなので、モデルパラメータが大きすぎないほうが優秀な可能性はある(実際、33B>65B)。 pic.twitter.com/rZQZkuJZiI
— 逆瀬川 (@gyakuse) February 24, 2023
ちなみに事前学習済みモデルはフォームからリクエストで研究用途等に使えるらしい(非商用)。自分も遊b研究したい〜!ってリクエスト送ってみた
— 逆瀬川 (@gyakuse) February 24, 2023
NECのGPUスパコンフルで使えば1.5ヶ月くらいでトレーニングできるし頼んだら貸してくれないかな…https://t.co/RYdH1GieS1
— 逆瀬川 (@gyakuse) February 24, 2023
5: 名無しのメタバースさん 0000/00/00(※) 00:00:00.00 ID:metaversesoku
「2048」というのはもしかして、グラボの型番ではなく、枚数なの…?と考えた瞬間にめまい。 https://t.co/2u0bqk7GF2
— CDB@初書籍発売中! (@C4Dbeginner) February 25, 2023
モデルは小型でも学習規模は小さくなってないな https://t.co/XZtv1aQAnV
— Yusuke Ando (@yando) February 25, 2023
「「「A100 80GB VRAM x 2048 x 21日間」」」 https://t.co/roCvFPR44x
— あき@『AI Vtuber』開発中 (@cumulo_autumn) February 24, 2023
$META から #LLaMA くん解放!
— forasteran (@forasteran) February 24, 2023
70億から650億パラメータまで複数サイズで提供のLLM🧠
130億パラのLLaMAなら1兆トークンで学習(🆚GPT-3は1750億パラでも僅か3,000億トークン、LaMDAは1370億個で1.56兆token)
抑圧調教のGPT-3よりも、LLaMAの方が汎用性が高いとか
遊びたいw https://t.co/170LZX6FWz
名前リャマよねw
— forasteran (@forasteran) February 25, 2023
発音はLlamaと同じラマ /ˈlɑːmə/ でいいのかな?リャマのが愛嬌ある?
中南米スペイン語発音だとジャマ(邪魔)
LLaMAくん、大きさの割に性能良いぽいし、面白い用例いっぱい産まれる気する
日本語はまだ多く含まれてないんで追加学習にも期待?やる人いるなhttps://t.co/4zCSkx2AE2 pic.twitter.com/nyL909RXoA
今日、Metaが最大650億パラメータの汎用言語モデル「LLaMA」を発表!(他には70億、130億、330億)。130億パラメータのモデルで多くのベンチマークで1750億パラメータのGPT-3を凌駕。最大モデルでは最先端の言語モデル「chinchilla」「PaLM」に近づく。研究コミュニティへ公開https://t.co/YeoSrPQ3qw
— 小猫遊りょう(たかにゃし・りょう) (@jaguring1) February 24, 2023
GPT3超えで限定とはいえ一般公開はあついですね! https://t.co/7njRWSuZQQ
— リーアルサン†中二病東大博士後期課程vtuber (@ArusanR) February 25, 2023
1: 名無しのメタバースさん 0000/00/00(※) 00:00:00.00 ID:metaversesoku
330億と650億パラメータの二つのモデルは1.4兆トークンで学習。最小モデル(70億パラメータ)でも1兆トークンで学習(通常よりも長く学習されているが、それでもまだ改善されたらしい)。GPT-3やChinchillaやPaLMとは違い、公的に利用可能なデータセットのみを使用し、この性能を達成しているとのこと
— 小猫遊りょう(たかにゃし・りょう) (@jaguring1) February 24, 2023
今後、「より大きなモデル」を「より大きな事前学習コーパス」で学習してリリースする予定とのこと。
— 小猫遊りょう(たかにゃし・りょう) (@jaguring1) February 24, 2023
ちなみに、LLaMA🦙はLarge Language Model Meta AIから命名している。
様々なタスクに関する指示データを用いた微調整(instruction tuning)も軽く実験していて、「LLaMA-I(650億パラメータ)」も作成。自然科学や社会科学や人文科学などの多くの学問における選択問題ベンチマーク「MMLU」でも68.9%を達成(5-shot)。ただ、OpenAIのcode-davinci-002は77.4%(最高性能) pic.twitter.com/NdGqMtoaPn
— 小猫遊りょう(たかにゃし・りょう) (@jaguring1) February 24, 2023
論文の著者の1人による紹介ツイート↓https://t.co/jf4yvi5hRf
— 小猫遊りょう(たかにゃし・りょう) (@jaguring1) February 24, 2023
論文の著者の1人。GPT-3が発表されてからまだ3年経ってないが、単一のGPUで実行できるGPT-3レベルのLLaMA-13Bが発表されているという状況。 https://t.co/4WeNrDvv4v
— 小猫遊りょう(たかにゃし・りょう) (@jaguring1) February 25, 2023
LLaMAはオープンソースらしいのでこれから応用例が出ると思うけど、どうせ賢いオタク達が先にいろいろするので、ワイはあとで参戦かな🤔 https://t.co/pDMjMIEm4u
— (´・д・`) _KYONSY69 (@kyonsy69) February 25, 2023
各社バラバラにLLM作らずに、みんなで協力して作ったら、一瞬でシンギュラリティ達成するのではないか?と思うことある。 https://t.co/QxEEy0vQUU
— 深津 貴之 / THE GUILD / note.com (@fladdict) February 25, 2023
むしろ相互に会話させてみたり、各社ごとの「性格」の違いでキャラ付けさせたり出来るからバラバラのほうが楽しそう https://t.co/NE7dBi7qGX
— あだな (@adana37P) February 25, 2023
_________________________________________________________________________________

コメントする