AI音楽・音声

AI音楽・音声

F5-TTSをローカルで動かす必要スペック|RTX 5080・5060 TiでVRAMと生成時間を実測

F5-TTSをローカルで動かすのに要るGPUメモリと生成時間を、RTX 5080とRTX 5060 Tiで実測した。VRAMを一番使うのは生成中ではなくモデルの読み込み中で、既定のチェックポイントでは約1,990 MiB。生成時間は2枚で1.73倍から1.99倍の差がついた。
AI音楽・音声

MiniMax Music 3をVRAM 16GBで動かす|RTX 5080実測、ピークVRAMは必要量ではない

MiniMax Music 3をRTX 5080 16GBのComfyUI構成で実測。4条件はいずれも60秒指定の生成を完走したが、観測されたピークVRAMは必要量ではない。使えるVRAMを削る掃引、1曲の所要時間の内訳、日本語ボーカルの歌詞追従までを測定値で示す。
AI音楽・音声

ローカルLLM常駐中にWhisperで文字起こしを回すと何が詰まるか|VRAMは足りてもGPU計算の取り合いで遅くなる

ローカルLLMを常駐させたままWhisperで文字起こしを同時に回すと、VRAMは足りてもGPU計算の取り合いで両方が遅くなる仕組みを、RTX 5080の単体実測とGPUの時分割から整理。画像生成との詰まり方の違い、KVキャッシュ、turboとint8、GPU分離、確認の手順まで解説する。
AI音楽・音声

Whisperをローカルで動かす必要スペック|large-v3とturboの必要VRAM・文字起こし速度を実測

Whisperをローカルで動かす必要スペックを実測。large-v3とturboをfloat16・int8で比べ、必要VRAMはいずれも5GB未満で8GBのGPUでも動作、turboはlarge-v3の約2.5倍速だった。faster-whisperでの結果と用途別の選び方をまとめる。