UnslothのQwen3.8-27Bは何かオリジナルよりいいらしぞ

@t_massann ところで実用的な速度で走ります?

@legasus Unslothの方はまだ試してないです。オリジナル?は思考の深さのレベルがデフォルトでExtra Highになっていて、メモリがかなり多くないと落ちるか、多くても思考に数時間かかったりするらしく、思考のレベルをMediumにすることで回避できるとのことです。

フォロー

@t_massann うちの環境では落ちることはないんですが、KV Cache が利用できない場合には多くの Prefill で待ち時間が発生して、応答開始までに極めて長い時間がかかるんですよねぇ。ただ賢いことは賢いです。

@legasus うちは今のところGemma4使ってますね。LM Studioでローカルサーバー建てて、AnythingLLMからそれに繋いで、Gemma4に現在日時を認識させて、Web検索して答えに反映させるようにデフォルトのプロンプト設定してます。すると「去年、流行ったものは?」と聞くと2025年の流行を検索して答えてくれます。

@t_massann Gemma のどのモデルだろう?うちは Gemma 系なら Gemma 4 12b qat 4bit をお客さんのメールシステムに組み込んで返信を考えさせるというのをやってます。

@legasus Gemma 4 26B-A4B QATかな。ちょっと今、手元にパソコンないので確認してませんけど。
小さいモデルもなかなか良いですよね。スマホのEdge Galleryに小さいモデル入れて遊んでます

@t_massann 外に出せない情報を小さいモデルで速く処理させるというのが現実的な使い方に思えますね。大きくやるなら課金した方が実用的という。Edge Gallery でモデルを DL してもそのままじゃ読み込めないバグは直ったんだろうか…。

@legasus Edge Galleryは全部は試してないですが、Gemma-4-E4B-itというのは普通に使えました。日本語の漢字の読みが怪しいですが、仕方ないですね

ログインして会話に参加
:realtek:

思考の /dev/null