Company

画像生成におけるVAEの周波数分離とその検証

VAEにおける、Reconstruction-Generation Gap のケアと様々なVAEの評価。

続きを読む →

Diffusion・Flow Matchingの統一的理解とone-step生成への考察

Diffusion・Flow Matchingモデルにおける予測空間(x-pred / ε-pred / v-pred)とカップリングスキームを統一的に整理し、pixel Mean Flow (pMF) による1ステップ生成の実証とFD-lossを用いた分布距離ベースのpost-trainingについて考察します。

続きを読む →

軽量な画像言語モデルによるアパレルドメインでのゼロショットクラス分類パイプラインの構築

アパレル業界の短い商品サイクルに対応するには、教師データ収集に頼らず低コスト・高速にインサイトを抽出できる仕組みが求められます。 本記事では、軽量な画像言語モデル SigLIP 2 を用いたゼロショットの柄(パターン)マルチラベル分類パイプラインの構築手法と、CLIP との性能比較結果を紹介します。

続きを読む →

ローカルで動かす日本語音声認識 - Moonshine Tiny(PyTorch)+ VAD 前処理

軽量な日本語ASRモデル Moonshine Tiny を、量子化なしの素の PyTorch で手元の音声に対して動かす手順を、ステップ・バイ・ステップで解説します。 素朴な全体一括の文字起こしが破綻する理由を確認したうえで、Silero VAD と1秒のオンセットバッファによる前処理を加えて実用的な精度にするところまでを扱います。

続きを読む →

プロンプトは手で書かない (TextGrad, DSPy, RAGASによる最適化入門)

SaaSサービスにおけるLLM活用が進む中、プロンプト品質の属人性と評価の難しさが課題となっています。DSPy・TextGrad・RAGASの3ライブラリを活用した、評価可能で再現性のあるプロンプト管理手法を紹介します。

続きを読む →

LLM開発コンペ2025参戦記: マルチノードで動かすvLLM そのハマりどころと要点

東京大学松尾・岩澤研究室主催のLLM開発コンペ2025における評価班の取り組みについて説明します。参加したRAMENチームはなんと予選通過を果たしました。そこで得た、LLMモデルをHPCクラスタ(マルチGPU/マルチノード)環境下でモデル評価ツールvLLMを動かすための注意点を列挙。原因・背景も記載したので、できれば機序を理解しつつFIXにご利用ください。

続きを読む →

テスト自動生成の新時代 - EARS記法とBDD(振る舞い駆動開発)とLLMと

要求工学の仕様記法である EARS (Easy Approach to Requirements Syntax) がLLMとの親和性を期待され、注目を集めている。本稿では、BDDで広く使われる Gherkin との構造的類似性を手がかりに、その応用実績からEARSがLLMによるコード/テスト自動生成の入力としてどこまで有効かを考察し、各現場で有効性を確かめるための定量評価の観点も示す。

続きを読む →

WebアプリでAIモデルを動作させる技術 (3) - IndexedDB

Webアプリでブラウザ上で動作するAIモデルを取り扱う際に突き当たる技術的な課題に関する考察シリーズの第三弾です。 本記事では、Webモデルのブラウザでのキャッシュに有効なWeb技術 IndexedDB を導入し、標準APIを使用して実践的なキャッシュ機構の実装方法を紹介します。

続きを読む →

WebアプリでAIモデルを動作させる技術 (2) - Web Worker

Webアプリでブラウザ上で動作するAIモデルを取り扱う際に突き当たる技術的な課題に関する考察シリーズの第二弾です。 本記事では、Web Worker を導入してブラウザの描画を阻害しないような性能改善の具体的な手法を紹介します。

続きを読む →

WebアプリでAIモデルを動作させる技術 (1) - Tensorflow.js

Webアプリでブラウザ上で動作するAIモデルを取り扱う際に突き当たる技術的な課題に関する考察シリーズの第一弾です。 本記事では、Tensorflow.jsライブラリを導入してシンプルなデザインパターンに基づくWebアプリを構築していきます。

続きを読む →