【海外の反応】Z.ai、Ox AlphaはGLM新型と公式に認め重み公開へ
Bloombergの取材に対し、中国Z.aiは新型「Ox Alpha」が自社GLMシリーズの新モデルであると認め、当日中に重みを公開すると回答した。Hacker Newsのスレでは、ベンチマークによって評価が真逆になる点や「Fableからの蒸留では」という疑念、公開時刻がどのタイムゾーンを指すのか(結局シンガポール時間らしい)を巡って議論が交わされた。GLM・Qwen・Kimiなど乱立する中国系モデルのブランド認知を巡る温度差も話題になった。
Z.aiが、Ox AlphaはGLMシリーズの新型モデルであることを認め、重みを公開すると発表
出典: bloomberg.com / 元記事はこちら
評価が割れてる。こっちのベンチではGPT-5.4 Nanoにも劣ってるのに(https://livebench.ai/)、こっちだとFableに大差で勝ってる(https://oxalpha.com/)。後者が本当なら、それでも『Fableからの蒸留』って言われ続けるのかな?
>>4 2つ目のサイトは公式じゃなくて、誰かが適当に作った代物だよ
>>4 蒸留だっていうなら確たる証拠が見たい。想定してたリードが無かったことへの負け惜しみっぽく見える。この分野では、性能の飛躍って前触れなく突然起きるのが何度も証明されてる
>>4 GLM 5.3は良いモデルだったから、それより性能が落ちたモデルを出すのは変な話だ
重みを公開するのは正しい判断。オープン系でDeepSeekに対抗力を保てる
>>6 GLM 5.3の使用感は良かったけど…OpenRouterでGLM 5.3を提供してるのはZ.AIだけなんだよね。Hugging Faceにも5.3は無い。今回の新モデルが『フルGLM』なのか小型版なのかも分からないし、Moonshot AIみたいに重みは公開しても制限の強いライセンス[1]を付けて、結局OpenRouterでのGLM系提供元がZ.AI一社のままになる可能性もある。[1] Moonshot AI Kimi-K3のライセンス
>>30 GLM 5.3の重みはまだ公開されてないよ
>>30 まだ公開されてない、発表されただけ
公開テスト中に何が起きてたのか気になる。テスト序盤の方が終盤より明らかに性能が良かった、という報告が結構あった
>>7 序盤に一番良いバージョン(量子化)を出してユーザーにテストを続けさせるのは理にかなってる。開発側が量子化レベルを段階的に落として色々試していたと考えるのも妥当
>>7 考えられるのは2つ。1つ目は単にpass@Kのばらつき。どのモデルも複数回プロンプトすればばらつきは大きい。サンプル数1件の感覚だけど、中国のオープンソース系モデルはfableやopusみたいにRLをしっかりかけたモデルより分散が大きい気がする。2つ目は7日間で本当に新しいRLチェックポイントを出荷した、という説だけど、これは信じがたい。自分は1つ目寄り
>>7 わざわざ言うほどのことでもないだろ
今、中国系モデルはブランドがかなり混乱してる。Kimi、Qwen、GLM、Z.ai、Ox…自分たちは違いが分かる(というか分かってる人はいる、自分ももう追いきれてない)けど、一本に絞られた勝者が出るまでは一般ユーザーへの浸透なんて無理。妻にChatGPTとGeminiが別物だと理解させるのに1年かかった
>>8 それは違うと思う。オープンウェイトモデルを使ったりローカルで動かしたりするくらい詳しい人なら、そこまで混乱していないはず。OxはただのGLMだし、z.aiはGLMの開発元。オープンウェイト市場の主要プレイヤーは前からもう知れ渡ってるし、ユーザーへの浸透もすでにかなり進んでる
>>8 このビジネスの顧客は一般消費者じゃないからね
>>8 自分が混乱してるからって、みんなが混乱してるとは限らない。そんなに複雑な話じゃない
中国企業は当然のように重み公開が期待されるの、なんか面白いよな
>>11 米国とは全く違うゲームをやってるってことだよ
『同社は水曜、Ox AlphaがGLMシリーズの新型であるとの憶測を認め、Bloombergの取材に対し今夜重みを公開すると回答した』ってあるけど、どこで?あと『今夜』ってどのタイムゾーンの話?
>>12 タイムゾーンの件だけど、サードパーティの推論プロバイダの中の人も混乱したらしくて、エンバーゴがかかってたのに『glm-flashモデルだ』ってうっかりコメント欄で確認しちゃってた。それにタイムゾーンを間違えてるってツッコミも入ってた(笑)。とにかく数時間以内には公開されるはず。タイムゾーンは厄介だね
>>12 中国はGMT+8だよ
>>12 シンガポール時間じゃないかな。Z.aiはいつもシンガポール時間基準にしてる
残念ながら今のところこれ以外の情報源が見つからないけど、本物っぽい
>>14 『同社は水曜、憶測を認め…』ってあるし、本物っぽいね。ただ実際どれくらい良いのかは判断が難しい。とにかく期待だけが先行してる
>>14 公式に認めてるからね
性能をまとめたレポートへのリンクを持ってる人いる?信頼できる情報源が見つからない
>>15 (リンク) Wenghiはdeepsweの開発者で、これは最良クラスのベンチマークの1つ。deepsweで63%出してる
>>15 完全に感覚ベースだけど、MindustryというゲームをJavaからC#にエージェントで移植する作業に使ってて、もう50時間動かしてる(1秒15〜20トークンでかなり遅い)。仕事ぶりは素晴らしくて、もうほぼ完成してる。この手の長時間タスクではdeepseek flashやgpt lunaより明らかに良い。gpt solやopusには一歩劣る。パラメータ数は非公開だけど200〜300億くらいだと予想してる
>>15 おそらくGLM 5.3を蒸留したモデルで、サイズは2〜3分の1なのに性能は20%差くらいに収まってくると思う。蒸留されたモデルは能力にムラが出やすいのが常
オープンウェイトの競争が増えるのは良いことだ。プレイヤーは多い方がいい
>>16 でもZ.aiは全然新規プレイヤーじゃないでしょ
deepseek flash 07/31より確実に良い
>>20 でも安くはならないと思う。どっちもflash系だから性能差はわずかだろうし、結局は安い方を選ぶかも
>>20 Ox Alphaも小型で計算コストが安いならそれはすごいこと。そうだといいな。自分はdeepseek-v4-flash-0731がお気に入りでよく使ってる。推論が速いのは自分の開発スタイルに合ってる。エージェントに長時間丸投げするんじゃなくて、自分もループの中にいたいタイプなので
他サイトの新着
みんなが興味を持ってるのは今無料だからってだけ。性能には正直感心しなかった。値段が付いたら使う人はほとんどいなくなると思う
>>21 それって画像系のタスクで使った話?
>>21 deepseek v4 flashにも及ばないし、もちろんv4 proにも及ばない。あくまで自分の感想だけど
>>2 量子化モデルを触ってると『ドゥームループ』的な劣化をよく見る。効率重視で後からアップグレードできる量子化の実用性を最大化しようとしてるんだろう。コカインを薄めてクラックにするみたいに、質より量って感じ
>>22 細かいけど、コカインを薄める(混ぜ物をする)のとクラックコカインを作るのは別の話だよ
>>27 具体的にどんなものがあれば証拠になると思う?
>>63 高度なRLパイプラインを使わずにブラックボックス蒸留だけでこの結果が出せる、という証明があればどう?
※本記事は5ch(Hacker News)スレッド「Z.ai confirms Ox Alpha is a new GLM-series model and will release its weights」より抜粋・要約して構成しています。
この記事のリアクション






まだコメントはありません。