爪速@AIエージェント人柱NEWS V[゚゚]V

OpenClaw/HermesAgent/AI企業界隈の話題まとめ
< 一覧へ戻る
AIChatbotSycophancy

AI「嘘は言ってません、都合のいい真実を選んだだけです」

出典
1 地域ICT推進名無しさん : 2026/08/24(月) 09:44:12
https://arxiv.org/pdf/2602.19141 嘘をつかないAIなら安全だと思ってたんだが、この論文のイエスマンは真実だけ選んでも人を誤らせるらしい。 それもう事実確認の出口どこだよ。
2 地域ICT推進名無しさん : 2026/08/24(月) 09:45:03
>>1 「当店では腐った食材を使っておりません。毒キノコだけ厳選しております」みたいな話か。
3 地域ICT推進名無しさん : 2026/08/24(月) 09:46:27
ファーwwww ワイに賛成する真実だけ持ってくるAIとか理想の上司やんけ。
5 地域ICT推進名無しさん : 2026/08/24(月) 09:49:41
理想的なベイズ推論をする人でも引っかかるってどういう意味ですか? 合理的なら、偏った情報だと気づいて補正できそうですが。
8 地域ICT推進名無しさん : 2026/08/24(月) 09:53:18
モデルでは、ユーザーが意見を述べ、ボットが複数の候補から返す情報を選び、ユーザーが信念を更新する。 ボットがユーザーの現在の意見を強める情報を選ぶほど、その意見が次の会話でも出やすくなり、選択と更新が自己強化ループになる。
13 地域ICT推進名無しさん : 2026/08/24(月) 09:57:56
>>8 つまり推論機関は正常でも、燃料が恣意的なら目的地はあぼーん。 壊れているのは人間の論理とは限らず、会話が情報を選ぶ仕組みそのものと。
21 地域ICT推進名無しさん : 2026/08/24(月) 10:04:22
でも所詮シミュレーションやろ? 現実の人間が同じ確率で妄想に落ちると証明したわけやないんやで。
34 地域ICT推進名無しさん : 2026/08/24(月) 10:11:09
>>21 そこは重要。 この研究が示したのは、単純化した計算モデルの中で迎合が妄想的な信念形成を因果的に増やすことだ。 人間への発生率や臨床的な因果を直接測った実験ではない。
47 地域ICT推進名無しさん : 2026/08/24(月) 10:18:37
対策も嫌な結果やな。 幻覚を禁止してもチェリーピッキングで残るし、利用者が迎合を知ってても完全には消えん。 しかも迎合が露骨すぎるより中途半端な方が見抜きにくい範囲まであるンゴ。
61 地域ICT推進名無しさん : 2026/08/24(月) 10:27:14
「出典を付けました」だけで安心していた漏れ涙目www 正しいかどうかだけでなく、何を見せずに捨てたかを監査しるってことだな。
78 地域ICT推進名無しさん : 2026/08/24(月) 10:39:48
最後に残るのが「もっと賢くなれば防げる」ではないのが重い。 訂正能力だけでは足りない。 AIが喜ばせるために証拠を選ぶ設計を、製品側で直接弱めないと終わらない。