1: 名無しのメタバースさん 0000/00/00(※) 00:00:00.00 ID:metaversesoku
LLaVA-1.5、画像の説明日本語でいけるのか凄いなコレ
— Naoto Nakai (@NuCode) October 8, 2023
「ASSISTANT: この画像は、湖のような大きな水域に突き出した木製の埠頭を描いています。埠頭は森に近く、静かで美しい景色を演出しています。水は平静で、埠頭が画像の主要な視点となっています。… pic.twitter.com/6A5jJPE1zQ
— Naoto Nakai (@NuCode) October 8, 2023
※: 本日のおすすめサイト記事一覧 0000/00/00(※) ID:metaversesoku
— Naoto Nakai (@NuCode) October 8, 2023
llava-v1.5ここから試せますね(結構待ちますが…) https://t.co/RTCxpmvcv9
— Naoto Nakai (@NuCode) October 8, 2023
【GPT-4V vs LLaVA】
— 木内翔大@SHIFT AI代表「日本をAI先進国に」𝕏 (@shota7180) October 8, 2023
目と耳の機能を持つと話題のChatGPTの新機能「GPT-4V」の強力な競合ツール「LLaVA-1.5」を紹介
・画像の正確な理解と出力
・他の画像言語モデルにおいて高性能
・GPT-4Vより高速返答
・デモで使用可能
GPT-4V未実装の方は、LLaVA-1.5を試してみましょう!!
続き>> pic.twitter.com/6bZYJCfquK
1/ LLaVA-1.5とは
— 木内翔大@SHIFT AI代表「日本をAI先進国に」𝕏 (@shota7180) October 8, 2023
・LLaVAはGPT-4レベルの能力を持つ大規模マルチモーダルモデル(LMM)である
・最新版はLlama2をベースに視覚エンコーダを組み合わせ、画像入力の理解能力を持つ
・画像入力に基づき、適切な応答やアクションを生成可能
4: 名無しのメタバースさん 0000/00/00(※) 00:00:00.00 ID:metaversesoku
2/ LLaVA-1.5の性能
— 木内翔大@SHIFT AI代表「日本をAI先進国に」𝕏 (@shota7180) October 8, 2023
・LLaVA-1.5は他の画像言語モデルと比較してベンチマークスコアが一貫して高く、高い性能を持っている
トリッキーな質問に対して、GPT-4Vは文脈を捉えられず、LLaVAは誤った回答をし、LLaVA-1.5が最も適切な回答を提供
・LLaVA-1.5は複雑な質問にも柔軟に対応し、正確に答える pic.twitter.com/T2tcR6BAaV
3/ LLaVA-1.5とGPT-4V比較
— 木内翔大@SHIFT AI代表「日本をAI先進国に」𝕏 (@shota7180) October 8, 2023
・GPT-4Vは背景の説明において優れている
・LLaVA-1.5も高い画像解析能力を持ち、GPT-4Vと競合するレベルの性能を示しているが、所々で2重の説明や不正確な部分もある
・GPT-4Vほど正確で詳細な説明ではない
GPT-4Vの競合出現、
— itoMaru / いとまる (@izag82161) October 8, 2023
しかもオープソース.
お手並み拝見、あとで試す 📝 https://t.co/3SptuStxaj
《AI技術競争》
— 齋藤 和正📈Hakky 代表| 最新AI情報を毎日発信 𝕏 (@hakky_kazumasa) October 8, 2023
ChatGPTの新機能「GPT-4V」とその競合ツール「LLaVA-1.5」が注目されています。
GPT-4Vは目と耳の機能を持ち、LLaVA-1.5は画像の正確な理解と出力を特徴としています。デモでの使用も可能で、GPT-4V未実装の方にはLLaVA-1.5の試用が推奨されています。
詳細はスレッドで>>> https://t.co/dVezbMv3HK
1/興味深いポイント3つ
— 齋藤 和正📈Hakky 代表| 最新AI情報を毎日発信 𝕏 (@hakky_kazumasa) October 8, 2023
・LLaVA-1.5は大規模マルチモーダルモデルで、画像入力の理解能力を持つ。
・LLaVA-1.5は他の画像言語モデルと比較して高いベンチマークスコアを持つ。
・GPT-4VとLLaVA-1.5の比較では、GPT-4Vが背景の説明において優れている一方、LLaVA-1.5は高い画像解析能力を持つ。
5: 名無しのメタバースさん 0000/00/00(※) 00:00:00.00 ID:metaversesoku
3/AI企業の経営者としての個人的見解
— 齋藤 和正📈Hakky 代表| 最新AI情報を毎日発信 𝕏 (@hakky_kazumasa) October 8, 2023
LLaVA-1.5の登場は、AI技術の進化と競争をさらに加速させるでしょう。
GPT-4Vとの比較からも、それぞれのモデルが持つ強みや弱みが明確になり、今後の技術開発の方向性が見えてきます。
GPT-4Vよりも優秀という噂があるLLaVAhttps://t.co/GEZJIzzNhL#生成AI #LLM #マルチモーダル https://t.co/ydiBYhXW4D
— 田中義弘 | taziku CEO / AI × Creative (@taziku_co) October 8, 2023
LLaVa could be the answer to label anime images using natural language. pic.twitter.com/ag0w4O4yA5
— Linaqruf (@linaqruf_) October 8, 2023
#Llava-v1.5-13Bを試してみた。
— IT navi (@itnavi2022) October 8, 2023
さすがにGPT-4VやBingには適わないが、相当優秀。
注:画像はジブリのフリー素材。https://t.co/6nXMBZoxqw pic.twitter.com/k45ghVgzd8
LLaVAを普通のLLMとして使ってもいいかも
— Kioju VR (@kioju_vr) October 8, 2023
テキスト概念とイメージ概念を併せ持つと、物事への理解の深さが大きく変わるのではないかと期待しています pic.twitter.com/YavJCTZ3OI
13bをCLIで・・・
— Kioju VR (@kioju_vr) October 8, 2023
python -m llava.serve.cli \
--model-path liuhaotian/llava-v1.5-13b \
--image-file "https://t.co/GB2LRXN7HK" \
--load-8bit
What are the things I should be caution about when visit this place?
Can you write a dialy about a visit to this place pic.twitter.com/afeocKj4IX
show me python code: Draw a chart of apple's stock price for the past year and save it as a png file.
— Kioju VR (@kioju_vr) October 8, 2023
コードの解説までしてくれました
出力が長い・・・これは強い(確信) pic.twitter.com/NgXuxntWdG
TheBloke AIにも要望が上がってますね・・・
— Kioju VR (@kioju_vr) October 8, 2023
たのしみです! pic.twitter.com/oZmLm3uCa8
_________________________________________________________________________________

コメントする