画像生成におけるVAEの周波数分離とその検証
VAEにおける、Reconstruction-Generation Gap のケアと様々なVAEの評価。
続きを読む →軽量な画像言語モデルによるアパレルドメインでのゼロショットクラス分類パイプラインの構築
アパレル業界の短い商品サイクルに対応するには、教師データ収集に頼らず低コスト・高速にインサイトを抽出できる仕組みが求められます。 本記事では、軽量な画像言語モデル SigLIP 2 を用いたゼロショットの柄(パターン)マルチラベル分類パイプラインの構築手法と、CLIP との性能比較結果を紹介します。
続きを読む →ローカルで動かす日本語音声認識 - Moonshine Tiny(PyTorch)+ VAD 前処理
軽量な日本語ASRモデル Moonshine Tiny を、量子化なしの素の PyTorch で手元の音声に対して動かす手順を、ステップ・バイ・ステップで解説します。 素朴な全体一括の文字起こしが破綻する理由を確認したうえで、Silero VAD と1秒のオンセットバッファによる前処理を加えて実用的な精度にするところまでを扱います。
続きを読む →LLM開発コンペ2025参戦記: マルチノードで動かすvLLM そのハマりどころと要点
東京大学松尾・岩澤研究室主催のLLM開発コンペ2025における評価班の取り組みについて説明します。参加したRAMENチームはなんと予選通過を果たしました。そこで得た、LLMモデルをHPCクラスタ(マルチGPU/マルチノード)環境下でモデル評価ツールvLLMを動かすための注意点を列挙。原因・背景も記載したので、できれば機序を理解しつつFIXにご利用ください。
続きを読む →