ai-audio

音声入力デスクトップツール

PythonGroq WhisperGeminicustomtkinterpynput

ai-audio — 音声入力からAI整形までのデスクトップツール

キーをひとつ押すとマイク録音が始まり、Groq Whisperが文字起こし、Geminiが読みやすく整形して、貼り付けるだけの状態でクリップボードに入ります。話すだけで文章の下書きができる個人用ツールです。


概要

グローバルホットキー → マイク録音 → Groq Whisper (whisper-large-v3-turbo)
                  → Gemini Flash-Lite で整形 → クリップボードへ自動コピー

このツールでこだわったのは、長い沈黙が続いても録音を止めないことです。吃音があると言葉が出るまでに時間がかかることがあるので、途中で録音が切れない作りにしました。整形時のプロンプトにも「あ行で始まる言い換えを避ける」といった指示を追加できます。


主な機能

メインウィンドウ

録音・履歴・設定の3タブ構成。整形結果はクリップボードへ自動コピーされ、生の文字起こしも確認できる

録音中のレベルメーター

録音中は小さなウィンドウに音量バーを表示する。無音が続いても録音は止まらない


技術スタック


アーキテクチャ

src/ai_audio/
├── __main__.py        CLIエントリ
├── config.py          設定管理(keyring + TOML)
├── controller.py      パイプラインの制御
├── audio/recorder.py  マイク録音(無音での自動停止なし)
├── hotkey/listener.py グローバルホットキー
├── stt/groq_client.py Groq Whisper
├── llm/
│   ├── gemini_client.py  Gemini フォーマッター
│   └── prompts.py        モード別の整形プロンプト
├── desktop/           clipboard / notifications / macos
├── gui/
│   ├── main_window.py    3タブのメインUI
│   └── compact_window.py 録音中の小ウィンドウ
└── storage/sessions.py   セッションの保存

パイプライン

録音 → Groq Whisperで転写 → 生テキストを保存
     → Geminiで整形(失敗したら生テキストを使う)
     → クリップボードへコピー → セッション保存 → OS通知

技術的な見どころ