2.8兆パラメータAIをMacBookで動かしたら1トークン/秒 海外掲示板で話題に

姉妹サイトの新着

他サイトの新着

海外掲示板Hacker Newsで、2.8兆パラメータ級の大規模言語モデル「Kimi K3」を、GPUやRAMに収まりきらないため通常は動かせないところを、MacBook ProにThunderbolt 5経由で接続した4台のSSDからモデルの重みを都度読み込む方式で動作させたという投稿が話題になった。速度は1トークン/秒と実用にはほど遠い遅さだが、投稿者は「動くこと自体に価値がある」と説明している。スレッドでは、これだけ遅くても「やる意味があるのか」という懐疑派と「とにかく動かせたことがすごい」というホビイスト気質を支持する声がぶつかり合い、あわせてREADMEの文章がAIによって書かれたものではないかという指摘も相次いだ。

MacBook ProでKimi K3(2.8兆パラメータ)を動かす、SSD4台からストリーミングして1トークン/秒

出典: github.com / 元記事はこちら

2 海外の名無しさん 2026-09-08 20:56
『銀河ヒッチハイク・ガイド』に出てくるディープ・ソートを思い出すな
16 海外の名無しさん 2026-09-08 21:15
>>2
5年前だったらこの速度でもとんでもなく革新的だと思われてただろうな。もしLLMが今より賢いけど今よりずっと遅かったら、使い方はどう変わるんだろう。プロンプトにもっと時間をかけて、準備にもっと力を入れるようになるんじゃないか
34 海外の名無しさん 2026-09-08 21:25
>>16
1トークン/秒でも、多くのタスクでは人間より速い。人間なら半週間かかることを一晩でやってのける計算になる。それに並列化すればいくらでも速くできる
35 海外の名無しさん 2026-09-08 21:24
>>16
うちの親はパンチカードでプログラミングを覚えた世代でね。プログラムを用意するのに1日、実行に1時間かけて、出てくるのが構文エラーだけだったらしい
3 海外の名無しさん 2026-09-08 21:09
普通サイズのプロンプトでもわずか11日で終わる
17 海外の名無しさん 2026-09-08 21:13
>>3
答えが出る頃には、自分でとっくに答えを見つけてる
18 海外の名無しさん 2026-09-08 21:12
>>3
普通サイズのプロンプトって100万トークンのこと?
4 海外の名無しさん 2026-09-08 21:36
今の時代、2.8兆パラメータをローカルで動かすなんて普通は不可能。だからこれは良いスタートだと思う
5 海外の名無しさん 2026-09-08 21:29
もっと速いSSDなら効果あるかな?eBayでOptaneの中古SSDがまだ買えるけど、結構高い(普通のコンシューマ向けNVMeより遅い偽物のM.2じゃなくて、本物のOptaneの話ね)
6 海外の名無しさん 2026-09-08 21:31
Kimiのためというより、GLM Flashみたいな軽量モデルのためにこそこの仕組みは面白いと思う
7 海外の名無しさん 2026-09-08 21:31
これは普通にすごいな
8 海外の名無しさん 2026-09-08 20:53
もはや次元の違うドM
19 海外の名無しさん 2026-09-08 21:01
>>8
そしてmacOS信仰でもある
9 海外の名無しさん 2026-09-08 21:09
SSD4台×40のRAID0にすれば40トークン/秒出るんじゃないか。それか4台構成のMacBookを40台使うか
10 海外の名無しさん 2026-09-08 21:34
コンテキストが20万トークン以上埋まった後の速度低下を想像してみろよ
11 海外の名無しさん 2026-09-08 21:00
SSDの接続方法についての説明を見落としたかも。バカな質問かもしれないけど
20 海外の名無しさん 2026-09-08 21:09
>>11
SSDはThunderbolt 5のエンクロージャー経由で接続してる。Gen4が1台とGen5が3台、それぞれエンクロージャーに入れてるよ。仕様はリンク先に書いてある
12 海外の名無しさん 2026-09-08 21:17
スター5個しか付いてないのにHNで1位になってるの初めて見たかも
13 海外の名無しさん 2026-09-08 21:31
こういうAI丸投げっぽいREADMEって読んでて辛い
15 海外の名無しさん 2026-09-08 20:17
でもなんでこれをやるんだ?こんな遅さじゃ実用性なんてあるはずないし、これだけ性能が悪いのにコストもかなりかかる
25 海外の名無しさん 2026-09-08 20:51
>>15
この掲示板全体のスタンスって「やらない理由がない」じゃないかな
27 海外の名無しさん 2026-09-08 20:37
>>15
そもそも動くこと自体がポイントなんだと思うけど…
28 海外の名無しさん 2026-09-08 20:56
>>15
GitHubのREADMEにそのまま「でもなぜ?」という項目があるよ
21 海外の名無しさん 2026-09-08 20:47
>>14
この返答、数字と特殊文字がぎっしりで多分1000トークンくらいある。1トークン/秒なら、MacBook Proでこれを生成するのに17分近くかかる計算になる
36 海外の名無しさん 2026-09-08 20:56
>>21
しかもKimiはこれを書く前に3万6千トークンも「思考」してるんだよな
37 海外の名無しさん 2026-09-08 20:53
>>21
それに、この情報を人間がまとめるならもっと時間かかりそう
22 海外の名無しさん 2026-09-08 21:03
>>14
ハイフンでつないだ用語が読み進めるほどひどくなっていく。もう勘弁してくれ

他サイトの新着

23 海外の名無しさん 2026-09-08 20:46
>>14
これ読みにくいから、gistにリンクするだけでよくない?
38 海外の名無しさん 2026-09-08 20:49
>>23
それ、コーディングエージェントの出力をそのままコピペしてるからだよ
45 海外の名無しさん 2026-09-08 20:55
>>38
少なくとも部分的には人の手が入ってるように見えるけど、Astra世代になると見分けるのがだいぶ難しくなってきたな…
46 海外の名無しさん 2026-09-08 20:53
>>38
改行が全然入ってないから読みにくいんだよ
26 海外の名無しさん 2026-09-08 21:28
>>15
LLMの使い道としてあまり注目されてないと思うのが分類マシンとしての利用。大量の入力を与えて、それを分類するトークン1つだけ出力させる。「このコードにバグはある?『はい』か『いいえ』で答えて」みたいな感じ。それなら1トークン/秒でも十分使えるかもしれない
29 海外の名無しさん 2026-09-08 20:48
>>15
実務には使えないけど、そもそも動くという事実自体が、強力なLLMをローカルで動かせる方向に進化してることの証拠になってる
30 海外の名無しさん 2026-09-08 21:05
>>15
できるからやる、それだけ。しかもK3は最先端級のモデルで、それがMacBook Proで動いてる
31 海外の名無しさん 2026-09-08 20:41
>>15
HNでこういうコメントを見るのは好きじゃない。昔は「こんなクレイジーなことやってみた」的な投稿にみんな投票してたはずだ。全部が全部、意味があったり画期的である必要はない。とにかく動かせたこと自体がすごいんだよ
41 海外の名無しさん 2026-09-08 20:46
>>27
実際ちゃんと役に立ってるよ。例えば毎朝30〜40分かけてレポートを自動生成して、それをPDFにしてTelegramに送るようにしてる
43 海外の名無しさん 2026-09-08 21:21
>>32
『そうでないふりをするつもりはない』って、いかにもClaudeっぽい言い回しだな。批判じゃなくて、ただ気づいただけ
44 海外の名無しさん 2026-09-08 21:07
>>36
それに投稿者は最初のプロンプトで1000トークンくらい送ってて、システムプロンプトにもっと何か入れてたのかもしれない。おまけにApple製ハードウェアはプロンプト処理が遅いことで有名だし
47 海外の名無しさん 2026-09-08 21:08
>>46
改行(\n\n)を削れば20秒くらいは節約できそうだけどね
48 海外の名無しさん 2026-09-08 21:02
>>46
それに、いかにもLLMが生成した文章っぽい特徴だらけだ

この話題の背景と論点

「Kimi K3」のような数兆パラメータ規模のMoE(混合エキスパート)型モデルは、推論時に使う重みの一部だけを都度読み込む構造を持つ。個人のPCが積めるRAMやVRAMの容量をはるかに超えるため通常は動かせないが、今回の投稿者はモデルの重みをメモリではなくSSDに置き、必要な部分だけをThunderbolt 5経由で逐次読み出す方式で動作を実現した。SSDの読み出し速度がボトルネックとなり1トークン/秒という遅さになっているが、これは複数のNVMe SSDを束ねてストレージ側の帯域を稼ぐという、GPUを買い増す以外の選択肢を示す試みでもある。スレッドで交わされた「実用性がない」「とにかく動くことに価値がある」という対立は、こうしたホビイスト的な実験投稿がHacker Newsで頻繁に見られる典型的な構図といえる。またREADMEの文体を巡ってAI生成を疑う声が上がった点は、近年GitHub上で増えている「AIが書いたと思しきドキュメント」への警戒感を映したものだ。

※本記事は5ch(Hacker News)スレッド「Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事