話題
2026年10月9日
16.9MBの超小型音声認識「Whistle」話題に 得意な英語、苦手なスペイン語訛り
Hacker Newsで、わずか16.9MBという超小型の音声認識(音声からテキストへの変換)モデル「Whistle」が話題になった。実際に試した利用者の反応は割れ、英語では強い訛りでも高精度に聞き取れたという声が相次いだ一方、スペイン語ではマドリードの発音は問題ないのにメキシコやベネズエラのアクセントだとうまく認識されないという報告も出た。ParakeetやDeepgram、Geminiの口述筆記機能との比較や、録音中にリアルタイム表示されない点への不満も上がり、話題は口笛で会話する言語の実例や、競合アプリの開発元FUTOのライセンス表記を巡る訂正にまで広がった。
Whistle: 16.9MBの軽量音声認識(音声からテキストへの変換)モデル
出典: cactuscompute.com / 元記事はこちら
2
海外の名無しさん
2026-10-08 18:53
適当に選んだテレビ番組の音声で試してみたら、たまにハマって「Thank you.」とだけ出力し続けることがある。一度は60秒分の会話がまるごと「Thank you.」になっていた(もちろん実際にそんなセリフが60秒続くシーンじゃない)。書き起こし中に何度か同じ現象が起きた。
3
海外の名無しさん
2026-10-08 18:18
このデモでできていないのは、録音中・発話中にリアルタイムで文字起こし結果をストリーミング表示すること(停止ボタンを押す前の段階)。汎用のライブ音声認識アプリとしては、これは必須機能だと思う。
23
海外の名無しさん
2026-10-08 18:46
>>3 まさにそれが理由で、自分はローカル動作のものよりDeepgramを使っている。
5
海外の名無しさん
2026-10-08 19:00
Webアプリに組み込んで出荷できるレベルのものとしては、かなり良い出来。面白い使い道がいくつか思い浮かぶ。
6
海外の名無しさん
2026-10-08 18:19
Parakeetと比べるとどう?自分はM系MacBookでローカルにParakeetを使っていて、かなり快調。会議の文字起こしやデモ動画の音声書き起こしには十分な速度と精度。これは明らかに軽くて速そうだけど、精度はどう比較になる?
7
海外の名無しさん
2026-10-08 17:33
最初「口笛をテキストに変換する」ものだと勘違いした。そっちの方がずっとクールなのに。
29
海外の名無しさん
2026-10-08 17:48
>>7 LLMの学習題材として面白いかもね。(カナリア諸島の口笛言語「シルボ・ゴメロ」へのリンク)
30
海外の名無しさん
2026-10-08 17:54
>>7 マーベルのヨンドゥみたいだ!
11
海外の名無しさん
2026-10-08 17:24
うわ、英語に関しては驚くほど正確。わざと聞き取りにくく喋ってみたけど完璧に理解された!ちょっと話はそれるけど、いい加減、みんなをイライラさせないスペルチェッカーくらい今の技術で作れるはずだよね(Appleのことだよ)。
12
海外の名無しさん
2026-10-08 18:42
このサイズでCPU動作ということを考えると、かなり優秀。
14
海外の名無しさん
2026-10-08 18:32
あれ、これはちょっと紛らわしい。自分のAndroidには既に「Whistle」という名前の音声認識アプリが入っている。
15
海外の名無しさん
2026-10-08 18:15
これは本当に素晴らしいリリース。開発チームにお疲れ様。いくつか単語を試したけど、インド訛りの自分の発音もちゃんと拾ってくれた。Linuxマシンで動かしてみるつもり。
16
海外の名無しさん
2026-10-08 17:40
このサイズでこのベンチマークは異常なレベル。お見事!
17
海外の名無しさん
2026-10-08 17:58
RuntimeError: audio limit is 30 s というエラーが出た。
31
海外の名無しさん
2026-10-08 18:06
>>17 30秒以上録音した?
18
海外の名無しさん
2026-10-08 17:42
20MB以下でCPU前提のモデルが増えてきているのは嬉しい。同じ思想(GPU不要・クラウド不要)のCLIが欲しい人には、自分が使っているyapsnapを勧めたい。ストリーミング対応のZipformer ASRで、話者分離とタイムスタンプもすべてCPUだけで処理できる。10言語対応で、文字起こしは無制限・無料。
19
海外の名無しさん
2026-10-08 17:49
Androidで動くのか気になる。
20
海外の名無しさん
2026-10-08 17:25
スペイン語の精度は良くない(存在しない単語を書いたり、ひどい誤字が出たりする)。でも英語は自分のスペイン語訛りでも割といい感じに動く。
34
海外の名無しさん
2026-10-08 17:26
>>20 どこのスペイン語?こっち(カスティーリャ・スペイン語)では問題なく動いたけど。
44
海外の名無しさん
2026-10-08 17:54
>>34 マドリード。でも一定のリズムではっきり口述する時しかちゃんと動かない(昔のViaVoiceの口述筆記みたいな感じ、覚えてる人いれば)。もっと自然な会話のリズムで話す(スラングも省略もなしでも)と、簡単に単語を取り違える。
45
海外の名無しさん
2026-10-08 17:53
>>34 メキシコやベネズエラのスペイン語はうまく認識されない。
22
海外の名無しさん
2026-10-08 18:03
対応言語をもっと増やせない?
36
海外の名無しさん
2026-10-08 18:24
>>22 (自分が紹介した)yapsnapなら10言語に対応してるよ。
26
海外の名無しさん
2026-10-08 17:59
>>4 これだけ小さいと、CPUのL3キャッシュに収まるサイズで、事実上常駐させて色々な用途に使えるということ。
27
海外の名無しさん
2026-10-08 17:54
>>4 話は逸れるけど、君のユーザー名好きだよ。
35
海外の名無しさん
2026-10-08 17:57
>>21 音声認識の話だよね?訛りや発音のクセが関係してるのかも。もしそうなら、Mozillaの Common Voice に自分の声を提供してみるのもいいかも。どのSTTの学習データにも使われているはずだから。
46
海外の名無しさん
2026-10-08 18:44
>>35 そうそう、音声認識の話。自分はアメリカ東海岸の標準的な訛りだけど、たまにモゴモゴ喋る癖がある。意識してゆっくり、喉の調子を整えて話すと多少改善したけど、それでも全部の単語を拾ってはくれない。
38
海外の名無しさん
2026-10-08 18:21
>>24 自分はGeminiのデスクトップアプリを口述筆記専用で使っている。これが奇跡的。強い訛りがある自分の発音の認識精度に、生まれて初めて感動した。ただ「ウィンドウに話しかける→推論」オプションは無効にしておくこと。そうしないとただの口述ではなく、勝手にメール全文を書かれてしまう。
39
海外の名無しさん
2026-10-08 18:56
>>25 これでSiri登場前のiPhone(2010年より前の話)を思い出した。当時は完全オフラインだったのに、「ライブラリ内の曲を再生して」という用途では、今の最新のものより精度が良かった。今だと自分のライブラリにちゃんとある曲なのに、聞いたこともないバンドの変な曲にマッチすることがある。
40
海外の名無しさん
2026-10-08 17:59
>>29 メキシコ南部のサポテカ族の子孫という人たちに会ったことがあるけど、今でも山あいの谷を挟んで口笛言語で会話しているらしい。
48
海外の名無しさん
2026-10-08 18:48
>>40 フランス南西部にも口笛言語を話す人が今も残っている。数は多くないけど、保存のために現地の学校で教えられているそうだ。
41
海外の名無しさん
2026-10-08 18:10
>>33 非営利条項がライセンスに含まれているから、「オープンソース」というより「ソース公開」止まりだと思う。
49
海外の名無しさん
2026-10-08 18:53
>>41 指摘ありがとう。この手のことには気をつけているつもりだったけど、今回は間違えた。訂正感謝。
42
海外の名無しさん
2026-10-08 18:11
>>33 Futoが出しているのは「ソース公開」止まりのプロプライエタリなソフトウェアで、オープンソースでは断じてない。何度も指摘されるまで、残念ながらずっとそう偽っていた。
50
海外の名無しさん
2026-10-08 18:54
>>42 その通り…これは完全に自分の間違い。教えてくれてありがとう!
43
海外の名無しさん
2026-10-08 18:11
>>33 FUTOのキーボードは長く使っているけど、音声入力は試したことがなかったので今試してみている。どれくらい正確に書き起こせるか見てみよう…うん、なかなか良い。
この話題の背景と論点
音声認識モデルの開発では近年、GPUやクラウドを使わずCPUだけで動く数十MB以下の軽量モデルが相次いで公開される流れがあり、Whistleもその一つ。公開時のベンチマークは英語中心で測定されることが多く、スレで出たスペイン語圏内でも地域によって精度差が大きいという報告は、ベンチマークの数字だけでは実際の多言語・多アクセント環境での精度を測りきれないことを示している。またFUTOのキーボードアプリを巡っては、非営利利用に限定するライセンス条項があるため、OSI(Open Source Initiative)が定める基準では「オープンソース」ではなく「ソースが公開されているだけの独自ソフトウェア」に分類される、という指摘が複数の参加者から出た。この区別は紛らわしく、開発元自身が過去に誤った表記をしていた経緯もあるため、読者が「ソース公開=オープンソース」と誤解しないよう注意したい点である。
※本記事は海外掲示板 Hacker News のスレッド「Whistle: Speech to Text in 16.9 MB」から抜粋し、編集部で日本語に意訳したものです。訳文の責任は当サイトにあります。
この記事のリアクション
まだコメントはありません。