2.8兆パラメータAIをMacBookで動かしたら1トークン/秒 海外掲示板で話題に
姉妹サイトの新着
他サイトの新着
- 5chまとめMAP【東京】東京外環道で逆走し逃走の女を都内で現行犯逮捕 銃刀法違反の疑い 警察は松戸IC付近で追跡打ち切り
- ニュース速報まとめMAP【速報】車がただの鉄屑に変わる瞬間。名古屋の大雨で被災した連中の「油断」をおまえら笑えるか?
- なんJ傑作まとめアンテナMAP【悲報】ワイ「髪切ってくれてありがと!」店員さん「4000円になります」ワイ「…は?」wwwwwwwwww
- アニメ声優まとめアンテナMAPワンピース、ワノ国編を読み返すわ
- VTuberまとめアンテナMAP【Vtuber】清楚のVとは誰か
- だめぽアンテナ【悲報】ヤニ猫のカンサイねこ、人間ち〇ぽに堕ちてしまうwwwww
- ヌルポあんてな海外「日本はよく大国になれたな…」 日本列島、さすがに災害が多すぎると海外でも話題に
- 2chまとめアプリ+【朗報】戦国ボウリングアニメ「Turkey!」の経済効果、市の事業費の10倍になってしまう
- News人【動画】えなこさん、配信中ずっとチラチラ見せつけてしまうwwwwwww他
- ブルーアンテナ三山賀子アナ、横乳おっぱい集中線がエッロ過ぎ最高!タマランね
- ウマーあんてな世にも奇妙な物語でタモリさんの後釜のストーリーテラーは誰がいいと思う?
- 勝つるあんてな!Kカップアイドル星乃うめのぽっちゃりの上限いっぱいをちょっと超えてるボディがたまらんち
- 2ちゃんねるアンテナ【爆笑注意】深夜に見ると危険な「ヤバ過ぎるほど笑った画像・最高な画像」wwwww
- 海外の反応アンテナ.comドイツ人「人間掃除機だ」田中聡、王者バイエルンを完封!鮮烈ブンデスデビューで現地サポが絶賛!【海外の反応】
- キター!アンテナ「もう米農家辞める」 高齢化と値下げで
- つべこアンテナ【ミストレ】9/11(金)20時から6周年生放送がある模様!!!アイドルイベが始まる・・・?
- 2ちゃんマップ【艦これ&一般】なんか今年水害多いですわね
- 即まとch直近半年のJuice=Juice出演番組、良かったのは? 5ch「CDTVの1回目はガチで泣いた」
- 海外反応・海外ニュースまとめ【海外の反応】鬼武者が発売1日で100万本突破→カプコンの次の復活シリーズは何がいい?
- おまとめ女後輩「ちょっと私のことハグしてもらえませんか」俺「え?」→結果www
海外掲示板Hacker Newsで、2.8兆パラメータ級の大規模言語モデル「Kimi K3」を、GPUやRAMに収まりきらないため通常は動かせないところを、MacBook ProにThunderbolt 5経由で接続した4台のSSDからモデルの重みを都度読み込む方式で動作させたという投稿が話題になった。速度は1トークン/秒と実用にはほど遠い遅さだが、投稿者は「動くこと自体に価値がある」と説明している。スレッドでは、これだけ遅くても「やる意味があるのか」という懐疑派と「とにかく動かせたことがすごい」というホビイスト気質を支持する声がぶつかり合い、あわせてREADMEの文章がAIによって書かれたものではないかという指摘も相次いだ。
MacBook ProでKimi K3(2.8兆パラメータ)を動かす、SSD4台からストリーミングして1トークン/秒
出典: github.com / 元記事はこちら
5年前だったらこの速度でもとんでもなく革新的だと思われてただろうな。もしLLMが今より賢いけど今よりずっと遅かったら、使い方はどう変わるんだろう。プロンプトにもっと時間をかけて、準備にもっと力を入れるようになるんじゃないか
1トークン/秒でも、多くのタスクでは人間より速い。人間なら半週間かかることを一晩でやってのける計算になる。それに並列化すればいくらでも速くできる
うちの親はパンチカードでプログラミングを覚えた世代でね。プログラムを用意するのに1日、実行に1時間かけて、出てくるのが構文エラーだけだったらしい
答えが出る頃には、自分でとっくに答えを見つけてる
普通サイズのプロンプトって100万トークンのこと?
そしてmacOS信仰でもある
SSDはThunderbolt 5のエンクロージャー経由で接続してる。Gen4が1台とGen5が3台、それぞれエンクロージャーに入れてるよ。仕様はリンク先に書いてある
この掲示板全体のスタンスって「やらない理由がない」じゃないかな
そもそも動くこと自体がポイントなんだと思うけど…
GitHubのREADMEにそのまま「でもなぜ?」という項目があるよ
この返答、数字と特殊文字がぎっしりで多分1000トークンくらいある。1トークン/秒なら、MacBook Proでこれを生成するのに17分近くかかる計算になる
しかもKimiはこれを書く前に3万6千トークンも「思考」してるんだよな
それに、この情報を人間がまとめるならもっと時間かかりそう
ハイフンでつないだ用語が読み進めるほどひどくなっていく。もう勘弁してくれ
他サイトの新着
これ読みにくいから、gistにリンクするだけでよくない?
それ、コーディングエージェントの出力をそのままコピペしてるからだよ
少なくとも部分的には人の手が入ってるように見えるけど、Astra世代になると見分けるのがだいぶ難しくなってきたな…
改行が全然入ってないから読みにくいんだよ
LLMの使い道としてあまり注目されてないと思うのが分類マシンとしての利用。大量の入力を与えて、それを分類するトークン1つだけ出力させる。「このコードにバグはある?『はい』か『いいえ』で答えて」みたいな感じ。それなら1トークン/秒でも十分使えるかもしれない
実務には使えないけど、そもそも動くという事実自体が、強力なLLMをローカルで動かせる方向に進化してることの証拠になってる
できるからやる、それだけ。しかもK3は最先端級のモデルで、それがMacBook Proで動いてる
HNでこういうコメントを見るのは好きじゃない。昔は「こんなクレイジーなことやってみた」的な投稿にみんな投票してたはずだ。全部が全部、意味があったり画期的である必要はない。とにかく動かせたこと自体がすごいんだよ
実際ちゃんと役に立ってるよ。例えば毎朝30〜40分かけてレポートを自動生成して、それをPDFにしてTelegramに送るようにしてる
『そうでないふりをするつもりはない』って、いかにもClaudeっぽい言い回しだな。批判じゃなくて、ただ気づいただけ
それに投稿者は最初のプロンプトで1000トークンくらい送ってて、システムプロンプトにもっと何か入れてたのかもしれない。おまけにApple製ハードウェアはプロンプト処理が遅いことで有名だし
改行(\n\n)を削れば20秒くらいは節約できそうだけどね
それに、いかにもLLMが生成した文章っぽい特徴だらけだ
この話題の背景と論点
「Kimi K3」のような数兆パラメータ規模のMoE(混合エキスパート)型モデルは、推論時に使う重みの一部だけを都度読み込む構造を持つ。個人のPCが積めるRAMやVRAMの容量をはるかに超えるため通常は動かせないが、今回の投稿者はモデルの重みをメモリではなくSSDに置き、必要な部分だけをThunderbolt 5経由で逐次読み出す方式で動作を実現した。SSDの読み出し速度がボトルネックとなり1トークン/秒という遅さになっているが、これは複数のNVMe SSDを束ねてストレージ側の帯域を稼ぐという、GPUを買い増す以外の選択肢を示す試みでもある。スレッドで交わされた「実用性がない」「とにかく動くことに価値がある」という対立は、こうしたホビイスト的な実験投稿がHacker Newsで頻繁に見られる典型的な構図といえる。またREADMEの文体を巡ってAI生成を疑う声が上がった点は、近年GitHub上で増えている「AIが書いたと思しきドキュメント」への警戒感を映したものだ。
※本記事は5ch(Hacker News)スレッド「Kimi K3 (2.8T) at 1 token/s on a MacBook Pro, streamed from four SSDs」より抜粋・要約して構成しています。






まだコメントはありません。