VLM
MiniCPM-V4.5 は、単一画像、複数画像、動画などを処理できるマルチモーダルLLMです。MiniCPM-V2.6 の進化版のようです。なぜ2.6から4.5なのか知りませんが、、、( ´ー`)y-~~ 個人的な感想ですが、この手のローカルで動かせるVLMで、複数画像や動画を処理で…
Sarashina2.2-Visionを味見していますSB Intuitionsが開発した日本語VLMで、Sarashina2-Visionの後継ですね。 Sarashina2と比べて日本語の理解力が上がっています3Bのわりに推論は重い気がしますが(L4 GPUで1分とか) sarashina2.2-vision-3bさん、日本の理…
Qwen3-VL を味見 Qwen2-VLやQwen2.5-VLも性能高くて良かったのですが、Qwen3-VLは、多様なタスク(2D物体検出や3D物体検出、OCRなど)をサポートし、日本語性能も高いので大変良いです。また個人的にはT4 CPU(2B、4B、8Bあたり)で動くのがポイント高いです…
LFM2-VL をお試ししています軽量なVLMです。CPUでも多少時間かかりますが動作します。ただし、ライセンスがちょっと独特なので、状況によっては仕事とかだと使いにくいかも。 LFM2-VL を味見しているかなり軽量(450M、1.6B)でCPU推論も何とか動くっぽい。…
SmolVLM2の味見をしています比較的軽量(256M、500M、2.2B)なVLMですが、Flash Attention2 必須のため、Ampere GPU以上(L4以上)が必要です。 SmolVLM2の推論味見と、ファインチューニング味見をしているただ、ファインチューニングの確認に使っている医療…
GLM-4.1V-9B-Thinking を味見しています👀 GLM-4.1V-9B-Thinking 味見している👀<think>てタグと、<answer>ってタグが推論結果にある pic.twitter.com/lQKSI9hkr7 — 高橋 かずひと@パワポLT職人 (@KzhtTkhs) 2025年7月5日 著者曰く、9Bというモデルサイズでありながら、18のベン</answer></think>…
AppleのFastVLMを味見しています出力トークン数が少なくなるようにすれば、それなりに早いです。 試してから気付いたのですが、Apple独自ライセンスのため、正直使いにくいと思います。 FastVLMを味見アウトプットを短くすれば、そこそこ早い pic.twitter.co…
Kimi-VLを味見しています精度は良いのでしょうけど、、、試した例では、L4 GPUで推論が3分かかって、ちょっと重い感じするなー Kimi-VL味見Q.What is the dome building in the picture? Think step by step(写真のドーム型の建物は何でしょうか?段階的に…
Heron-NVILAを味見しています1B、2B、15B、33B の4種類があります(2025/5/12現在) 詳細はTuringさんのZennのテックブログに記載されています。 1Bでも、かなり良い感じに推論してくれますね Heron-NVILA を Colaboratoryで味見している1Bでもこの精度は凄…
Sarashina2-Visionを味見しています8B、14B の2種類があります(2025/3/17現在) SB Intuitionsが開発した日本語VLMで、公開されている正解率はかなり高いです。 / SB Intuitionsテックブログ新着記事のお知らせ‼️\先ほど公開した8B, 14BパラメータのVLMに…
Qwen2.5-VL を味見 Qwen2も性能高かったので、こちらも良い感じ。個人的にはT4(3B、7B)で動くのがポイント高いです。72BはColaboratoryでは動きませんが。 Qwen2.5-VLが性能高いのは分ってたけど試していなかったのでColaboratoryで実行 pic.twitter.com/W…
Ovis2を味見しています日本語も対応しているVLMも増えましたね。 1B、2B、4B、8B、16B、34Bのモデルがあります。Ampere対応のGPU必要なのでL4以上じゃないと動きませんが、推論は結構早いです(試した範囲だと5~10秒くらい)1~8BはL4 GPUで動作可能、16Bは…
Asagiを味見しています2B、4B、8B、14B の4種類があります(2025/3/1現在) VRAMの使用量はモデルサイズ相応ですね。個人的な印象ですが、ちょっと推論は重い気がします。あまり試していないので、何とも言えませんが、日本特有のものに対しての回答率が若干…
Ivy-VLを味見しています3BオンリーのVLMのようです。3Bの割には精度が高いと思いますが、Ampereアーキテクチャ対応のGPU必要なのでL4以上必須ですね。 Ivy-VLも味見中こっちは3Bオンリー?3Bの割には推論結果ボチボチだと思う。What is shown in this image?…
InternVLを味見しています 1Bや2Bなどの軽いモデルもあり、T4 GPUでも動きます。精度はふつー?いや、細かい検証とかVLMベンチ試していないので、大きな違いが分からないのですけども。 InternVLの味見1B、2B、4B、8B、26B、40Bとあるけど、1Bとか2BはT4でも…
はじめに Pycon mini 東海 2024 でトーク発表してきました。今年は全然LTとか発表していなくて、ここでの発表で今年2回目でした。久々すぎて緊張しましたね。。。( ´ー`)y-~~でも、オフラインの発表でしか出ない脳汁があることを再認識しました 会場は、中…
1.3B と言う軽さで、画像認識も画像生成も出来るJanusを味見しています。ただ、研究として異議はあるかもですが、運用として認識も生成もしたい状況ってないんですよねー。この構造のおかげで1.3Bと言う軽さに寄与している? 性能は中々だと思います。ただ、…
以下を試したときのメモをZennに書きましたまあ、正直小細工ではあります。すぐにこんな小細工も必要ないくらいGPT進化すると思っていますが。。。 OpenAIのSwarmさんで画像認識を試しています。とりあえず、GPT-4o miniが苦手な座標取得を依頼された時に、F…
Molmoより先に試していたのですが、、、Molmoが突如現れて、一部の認識機能(位置把握とかカウント能力)でちょっと衝撃的だったので、後回しにしてしまっていました。。。 一番小さいモデルで0.5BのVLMです。ただ、Flash Attention採用してて、Ampereアーキ…
VLMもじゃんじゃんリリースされますね。Apache2.0 の OSS で GPT4V より認識性能が高いらしいです GPUメモリ的にColaboratoryだとA100必須だけど、このVLMの性能は凄いな2枚目は可視化したものだけど、位置も良さそう pic.twitter.com/J4NvC7CrT5 — 高橋 か…
とりあえず動かしたノートブックです。ちょっと色々試す時間なかったので、いったん共有です👻 github.com
Alibaba が 公開した Qwen2-VL を Colaboratoryでお試ししていますいくらか試していますが、かなり認識性能が高い気がします。多言語対応していて、日本語入力、日本語回答が出来るのもポイント高いですね。 そういえば、オープンな重みで日本語入力、日本語…
苦手です ※2024年8月30日現在 と言うか、前々から色々なVLMに対して言及されていた課題ではありますが、、、(特にGPT4Vで指摘されることが多い印象) お仕事でプロトタイプ検証した時も感じておりましたが、仕事の内容なので、はてブに書くわけにもいかず、…
MiniCPM-V2.6 は、単一画像、複数画像、動画などを処理できるマルチモーダルLLMです。個人的な感想ですが、この手のローカルで動かせるVLMで、複数画像や動画を処理できるものは珍しい気がしますね MiniCPM-V2.6は、公式の説明では以下のような特徴があるら…
Microsoft が 公開している軽量VLMのFlorence 2をColaboratoryで味見しています。 Florence 2 は以下のようなタスクが実行できるモデルです。一般的にVLMで言う、フリーワードでのプロンプトではなく、タスクに応じたプロンプトの指定が必要です。 CAPTION:…
軽量なVLMのMobileVLM V2です。以下はシンプルなプロンプトですが、T4 GPUで約250msとかなり早いです そーいえば、MobileVLMも触りかけて放置してたのですが、Colaboratoryで改めて触りましたシンプルなプロンプトですが、T4 GPUで約250msと言うのは流石に早…
サンプルスクリプト動かしただけですが、、、 精度良さそうな気がします 遅くなったけど、サイバーのCALM2の日本語VLMをColabで味見した最低L4のGPUじゃないとメモリ不足で動かない pic.twitter.com/5KKQxCxqLP— 高橋 かずひと@闇のパワポLT職人 (@KzhtTkhs)…
進化していますね どーいう学習とかアーキ変更とかしたら、スキマナースに対応できるよーになるのか分からん https://t.co/cL8eh9tcuK — 高橋 かずひと@闇のパワポLT職人 (@KzhtTkhs) 2024年5月13日 これ読めてるのすげーな「鉢は金属製で、1つの鉢には「TOD…
VLMは結構興味あって、案件やプライベート含めちょいちょい試しています 身も蓋も無いこと言うと、現時点ではGPT4V(要課金)の性能が図抜けているのですが、、、OSSで簡単に動かせるVLMも、turingmotors/heron や tosiyuki/LLaVA-JP など出てきていて、前提…