1 地域ICT推進名無しさん : 2026/09/03(木) 07:34:12
2 地域ICT推進名無しさん : 2026/09/03(木) 07:36:01
>>1
6週間でFlash系3回リリースの方が怖い。
モデル番号がブラウザのタブみたいに増えていくお。
3 地域ICT推進名無しさん : 2026/09/03(木) 07:38:44
3.8 Flashは入力100万トークン0.75ドル、出力3.75ドル。
3.7と同じ導入価格で推論とコーディングを上げたという話だな。
5 地域ICT推進名無しさん : 2026/09/03(木) 07:42:19
>>3
同じ値段で賢くなった!勝ったで!
なお複雑な仕事では
よく考えるためにトークンを多めに食う模様。
8 地域ICT推進名無しさん : 2026/09/03(木) 07:45:03
そこは公式も正直に書いてる。
効率優先ならeffortを下げるか、3.7 Flashを使い続けろとさ。
11 地域ICT推進名無しさん : 2026/09/03(木) 07:49:28
DeepSWEで大型モデルの多くを上回ったというのはkwsk。
長時間の自律コーディングで安いFlashが粘るなら、エージェント用途には刺さる希ガス。
17 地域ICT推進名無しさん : 2026/09/03(木) 07:54:51
マジレスすると派手なデモよりHLE-Verified 54.9%の方を見たい。
金融や法務のエージェント系ベンチでも3.7から伸びていて、単発回答より道具を何度も呼んで仕事を完走する設計へ寄せている。
23 地域ICT推進名無しさん : 2026/09/03(木) 08:01:07
一発プロンプトでDOS版Google Mapsまで作ったとか書いてあってワロス。
未来の地図を作るモデルに、わざわざDOSの革ジャン着せる香具師すき。
31 地域ICT推進名無しさん : 2026/09/03(木) 08:08:33
Cyber版は20言語にまたがる内部ベンチで脆弱性発見の成功率70%超。
C/C++中心のCyberGymだけでなく、現場に近いコード群まで広げたのは筋がいい。
44 地域ICT推進名無しさん : 2026/09/03(木) 08:16:20
>>31
直す方もCWE-Benchでpass@1が47.2%。
先頭モデルの47.8%に肉薄しつつ安いなら、
攻撃デモよりパッチ生成を優先したのは残当やな。
52 地域ICT推進名無しさん : 2026/09/03(木) 08:24:46
Chromeでは大型の商用モデルより正しいパッチを2.6倍多く出したらしい。
数字が強すぎて逆にベンチの条件表を読みに行きたくなるやつ。
63 地域ICT推進名無しさん : 2026/09/03(木) 08:37:12
GoogleのCloud Vulnerability Researchでは、普通なら発見に数か月かかる級の重大な基盤脆弱性を2時間未満で見つけたとのこと。
((((;゚Д゚))))
71 地域ICT推進名無しさん : 2026/09/03(木) 08:45:59
で、一般人がCyber版で遊ぼうとするとFairwind Programの審査。
政府機関、重要インフラ運営者、ソフトウェア保守者など信頼された防御側へ優先提供だと。
79 地域ICT推進名無しさん : 2026/09/03(木) 08:58:14
>>71
強いモデルを作る話と、強いモデルを誰に渡すかは別の設計なんだよな。
3.8 Flashは広く配り、Cyberは門を狭める。賢さより最後は鍵の管理か。