MINICPM · PRIVATE INFERENCE
小さなAIを、GPUで。
WebGPU: 確認中
shader-f16: 確認中
Backend: 未ロード
TTFT —s
速度 — tok/s
生成 —
モデル未ロード。WebGPU対応環境ではGPUを優先します。
設定・端末情報
テキストモデルは Transformers.js 4.3.0 + ONNX Runtime WebGPU を優先。
WebGPU / shader-f16 が使えない場合は MiniCPM5-2B GGUF を wllama/WASM で実行します。
画像モデルは現時点では MiniCPM-V 4.6 GGUF を wllama で実行します。
Ternary Bonsai 4Bは公式Q2_0 group-64 GGUFをwllamaで実行します。対応環境ではGPUを優先し、GPUが使えない場合はCPU / Context 1024へ自動的に切り替えます。速度優先のため内部思考は無効化します。