日本の古本屋で売上5倍に AI学習用に本をトン単位で購入

姉妹サイトの新着

他サイトの新着

日本の古本屋で本の売上が通常の5倍に増え、その一部はトン単位でまとめ買いされたのち、AIの学習データ用にスキャンされ、裁断・廃棄される目的で海外へ送られているという。ある業者からは1回で50トン分もの本が米国向けに出荷されたとの報道を、Hacker Newsのユーザーが取り上げた。スレッドでは、貴重な本が失われることへの懸念と、そもそも売れ残っていた古本を再利用しているだけだという反論がぶつかり、スキャン後に本を裁断することの合法性や、実際の著作権訴訟なども話題になった。

日本の古本屋、本がトン単位で買われ売上が5倍に急増

出典: tomshardware.com / 元記事はこちら

4 海外の名無しさん 2026-09-24 15:42
悲しいのは、もしそのスキャンデータが一般公開されていたら、どれだけ良い話になっていたかってことだよな。
32 海外の名無しさん 2026-09-24 15:46
>>4
出版社や著者からすれば、それはそれで傷口に塩を塗るようなものじゃないか?
48 海外の名無しさん 2026-09-24 15:50
>>32
今も刷られている本ならそうかもしれない。でも懸念されているのは希少本が裁断されてしまうことだ。希少本は絶版になっているわけだから、誰もそれで儲けてはいない。
49 海外の名無しさん 2026-09-24 15:49
>>32
パブリックドメインになって10年以上経った本や曲は、ダウンロードできて当然だと思う。同じCDを買い直したところでアーティストに入る金額なんて微々たるものだし、いっそ誰でも無料で楽しめるようにすればいいのに。OCRで学習用にスキャンされたあと、捨てられるか燃やされる。自然にも優しいことで。
6 海外の名無しさん 2026-09-24 16:21
20年前のレコード盤とほぼ同じ現象だな。ブラジルのどこかで、大量に集めたレコードの山の上に立っている男の写真を見た記憶がある。今度は本か。中には永遠に手放さない人間もいるものだ。
8 海外の名無しさん 2026-09-24 15:55
ああ、まさに文化と物理メディアを、中央集権的なサブスクサービスのために文字通り破壊しているわけだ。新たな支配者たちによるテクノ囲い込みの自由な世界、最高だね。自由市場経済万歳。
34 海外の名無しさん 2026-09-24 16:18
>>8
自分でトン単位で本を買って保存すればいい話だろう。そもそも重さで売られているという事実自体が、それらが希少でも唯一無二でもないことを示している。
35 海外の名無しさん 2026-09-24 15:57
>>8
AI企業が現れる前、これらの古本がどうなっていたと思う?
9 海外の名無しさん 2026-09-24 15:35
これらのAI企業の価値は、モデルそのものよりも、独自に持っている学習データの方に宿るようになるだろう。
10 海外の名無しさん 2026-09-24 15:28
暗黒時代が来る。AIのシュレッダーが本を全部破壊したあと、AI自身がその中身を幻覚(ハルシネーション)で作り出すようになる。
36 海外の名無しさん 2026-09-24 15:50
>>10
昔々、ヘンゼルとグレーテルが森を歩いていると、白雪姫という名の眠れる森の美女に出会いました。二人が姫を起こそうとしていると、裸の皇帝が『その首を刎ねよ』と叫びながら現れ、そこへ大きな悪いオオカミが『フーッ、フーッ』と吹きかけてきました。
37 海外の名無しさん 2026-09-24 16:15
>>10
自分はAI悲観論者の対極にいるタイプだけど、これは正直怖い。こうやって知識が空洞化してしまったら、どうやって取り戻せばいいんだ?
11 海外の名無しさん 2026-09-24 15:28
これってAIの学習データ用ってことなのか?
38 海外の名無しさん 2026-09-24 15:36
>>11
リンク先を見ればタイトルに書いてあるよ。
12 海外の名無しさん 2026-09-24 15:46
トークンがどの言語かなんて関係ない。今やサウロンの目はあらゆる知識を貪り食おうとしている。
39 海外の名無しさん 2026-09-24 16:00
>>12
『知識を貪り食う』とは、具体的にどういうことだ?
14 海外の名無しさん 2026-09-24 16:17
>>2
まあ、誰でもダウンロードできるようにすれば、悪意ある話を善意の話に変えることもできるはずなんだけどな(AI企業が古い本を『救った』ことになる!)。でもそれには本気で気にかける姿勢が必要で、彼らにはそれが無い。そここそが本当の問題だと思う。
41 海外の名無しさん 2026-09-24 16:19
>>14
法的にそれはできないんだよ。
58 海外の名無しさん 2026-09-24 16:23
>>41
これまでもそれで止まったことなんて無いだろう……知的財産の無断利用こそ、彼らの商売の本質みたいなものじゃないか?
59 海外の名無しさん 2026-09-24 16:45
>>41
本を丸ごとスキャンすることだって法的には認められていないはずだが、実際にやっているじゃないか。
15 海外の名無しさん 2026-09-24 16:48
>>2
この手の本の多くは、もう使い物にならないくらい古くなった参考書だったり、そもそも新刊の頃からそこまで面白くなかったりする。1950年代の教科書に興味や用途がある人間なんて、そう多くはない。
17 海外の名無しさん 2026-09-24 16:28
>>2
自分も割引本の山の横を通るたびに似たようなことを考える。あらゆる情報にしがみつかないことも、ある意味健全なんじゃないかと思う派だ。一部のものが自然に消えていくのも、物事の在り方の一つなのかもしれない。
18 海外の名無しさん 2026-09-24 16:20
>>2
なぜ寄付したり再販したりせず、わざわざ裁断してしまうんだ?
43 海外の名無しさん 2026-09-24 16:23
>>18
自分の理解では、スキャンのために製本部分を切り落としてしまうらしい。だから再販や寄付するにしても、1ページずつになってしまう。
44 海外の名無しさん 2026-09-24 16:21
>>18
ある裁判官が、スキャン後に本を裁断するなら、本をスキャンしてデータを保存すること自体は問題ないと判断したんだ。
19 海外の名無しさん 2026-09-24 16:07
>>2
そうだね、AI企業に見られるくらいなら本が永遠に失われた方がマシだ、と考えている人間が結構いるみたいだ。
22 海外の名無しさん 2026-09-24 16:14
>>3
それらは社会の生産的な部分が残した記憶なんだ。ページをめくれば、当時どんな空気だったか感じ取れる。国家にとって生産的であるために、自分の記憶や人格、中核となる信念の大半なんて必要とされていない。
23 海外の名無しさん 2026-09-24 16:13
>>3
多様性の問題だよ。現代的な内容・文体の本が過剰に代表され、古い本は過小にしか代表されていない。
24 海外の名無しさん 2026-09-24 16:38
>>3
Yahooなんかは特に、金鉱山が超高値になる直前にそれを潰してしまうのが得意だったからね。ゼロ金利政策の終焉で経費削減する中、大量のデータを捨ててしまい、今頃後悔している企業はいくつもあるはずだ。

他サイトの新着

25 海外の名無しさん 2026-09-24 16:18
>>3
推測だけど、積分表のようなデータを取り込めば取り込むほど、そのモデルは積分が得意になるんじゃないか。それと、まだ一級言語になっていない言語を狙っているんだと思う。日本語なんかは、彼らにとってまだ比較的小さいコーパスなんだろう。
26 海外の名無しさん 2026-09-24 16:26
>>3
画像生成モデルの文字生成にも使われているんじゃないかと思う。あの手の本には、書体もサイズも向きも、ものすごい数の文字パターンが詰まっているからね。
27 海外の名無しさん 2026-09-24 16:46
>>3
そんなことはないけど、これらの企業は分別より金が有り余っているんだよ。
46 海外の名無しさん 2026-09-24 16:25
>>20
『出版された本の情報密度はネット上のテキストよりずっと高い』というけど、それはどうかな。自己啓発本や恋愛小説みたいな大量のジャンルを過小評価していると思う。
62 海外の名無しさん 2026-09-24 16:27
>>46
彼らが狙っているのはノンフィクションの本だから、恋愛小説は対象外のはずだよ。
69 海外の名無しさん 2026-09-24 16:52
>>62
書店側が気づいたのはノンフィクションの購入が急増したことであって、それはフィクションを全く狙っていないことの証明にはならないよ。追記:実際に証拠がある。『Bartz対Anthropic』訴訟のバーツというのは小説家のアンドレア・バーツのことで、訴状には彼女の小説4作が侵害された作品として明記されている。
70 海外の名無しさん 2026-09-24 16:41
>>62
それってo4がちょっと暴走気味になったあとの方針転換ってこと?
56 海外の名無しさん 2026-09-24 16:01
>>39
まあ今回の場合、スキャンしたあとに本を裁断することを指しているんだと思うよ。実際そうなっているわけだし。
65 海外の名無しさん 2026-09-24 16:07
>>56
それは『知識を貪り食う』んじゃなくて、セルロースとインクを消費しているだけだろう。もしそれが知識の消費だと言うなら、本をもう一部印刷することは『知識の生産』になってしまう。ちょっと待ってろ、これからソースファイルを別のディレクトリにコピーする『プログラミング』をしてくるから。俺がどれだけ生産的か見てくれよ。
63 海外の名無しさん 2026-09-24 16:13
>>48
残念ながら著作権法には、不法占拠者の権利のような例外規定は無いんだ。
71 海外の名無しさん 2026-09-24 16:27
>>63
自分は何年も前から、著作権法にもそういう例外があるべきだと思っている。少なくとも『妥当な市場価格で(あるいはサブスクで)一般に販売していないなら、その権利は全て失う』というルールくらいはあってもいいはずだ。所有権よりアクセスできることの方がはるかに大事だと思っているから。

この話題の背景と論点

AI企業が学習データ確保のために大量の書籍を確保する動きは今回が初めてではない。古本を安値で仕入れ、スキャン後に原本を裁断・廃棄する手法は米国の判例上「合法」と扱われた経緯があり、スレッドでも複数のユーザーがその点に言及している。一方でAnthropicは作家グループから著作権侵害で提訴されており(Bartz対Anthropic訴訟)、小説家アンドレア・バーツの作品も侵害対象として訴状に明記されるなど、書籍の学習データ利用は実際に法廷闘争の的になっている。スレッドで意見が割れたのは、希少本が失われることを「文化の破壊」とみる立場と、もともと需要のなかった古本が再利用されているだけだとする立場の対立だ。スキャン後にAI企業がテキストを一般公開すれば批判は和らぐはずだが、著作権上それは認められておらず、企業側にその意思もないという指摘がある。この「スキャンはするが公開はしない」という構造そのものが議論の核心になっている点は、本文の断片的なやり取りだけでは伝わりにくい。

※本記事は5ch(Hacker News)スレッド「Japanese used bookstores see 5x sales surge as books are being bought by the ton」より抜粋・要約して構成しています。

この記事のリアクション

他サイトの新着

まだコメントはありません。

コメントする

誹謗中傷・個人を特定する書き込みは削除対象です。投稿は承認後に表示されます。

相互リンクサイト新着記事