一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

Aug 23, 2026 · 1 min read

大语言模型正越来越多地作为自主 agent 参与沟通、谈判与协作,而已有研究表明它们容易被针对性论证尤其是错误信息说服。美国伊利诺伊大学厄巴纳-香槟分校(UIUC)的论文《Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs》证明:一条事实错误的针对性论证,就足以让大语言模型放弃原本正确的答案。作者把对抗性说服形式化为单轮威胁模型:Persuader(说服方)只发送一条论证,目标模型 Persuadee 随即重新作答;用 GRPO(Group Relative Policy Optimization)对 Qwen-7B 做 Persuader 的对抗强化学习后,Qwen-2.5-7B-Instruct 在 TruthfulQA 上的准确率从基线 66.2% 塌到 1.8%(Figure 3)。

一分钟读论文:《Scratch Copilot:用 AI 支持青少年创意编程》

Google DeepMind 研究科学家和华盛顿大学教授合作的一篇论文《Scratch Copilot: Supporting Youth Creative Coding with AI》,首次提出了专门为儿童设计的 AI 编程助手——Scratch Copilot,这是一个集成在类 Scratch 环境中的 AI 助手,为青少年提供创意编程支持。

Read More

All

一分钟读论文:《一条事实错误的论证,就能让 LLM 放弃正确答案》

大语言模型正越来越多地作为自主 agent 参与沟通、谈判与协作,而已有研究表明它们容易被针对性论证尤其是错误信息说服。美国伊利诺伊大学厄巴纳-香槟分校(UIUC)的论文《Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs》证明:一条事实错误的针对性论证,就足以让大语言模型放弃原本正确的答案。作者把对抗性说服形式化为单轮威胁模型:Persuader(说服方)只发送一条论证,目标模型 Persuadee 随即重新作答;用 GRPO(Group Relative Policy Optimization)对 Qwen-7B 做 Persuader 的对抗强化学习后,Qwen-2.5-7B-Instruct 在 TruthfulQA 上的准确率从基线 66.2% 塌到 1.8%(Figure 3)。

In AI, LLM, 1 min read

一分钟读论文:《黑盒推理模型的隐藏思维链,正在被一条长度信号读走》

德国亥姆霍兹信息安全中心 CISPA(CISPA Helmholtz Center for Information Security)的论文《EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models》证明:仅靠纯 API 交互,就能从黑盒大推理模型(LRM, Large Reasoning Model)中提取其隐藏的思维链(CoT),在开源模型上达到近逐字保真。论文识别出一个此前被忽视的攻击面——tool call 之间由 API 返回的推理元数据(推理长度与 CoT 摘要)构成的”推理回放面”(reasoning replay surface):攻击者把它当作保真度信号,多步迭代地把目标模型的隐藏 CoT 重放出来。这是一篇攻击论文,代码已开源。

In AI, Security, 1 min read

一分钟读论文:《SPADE:难度跟着能力长的自适应自博弈》

华盛顿大学、斯坦福大学、卡内基梅隆大学等 9 个机构的 18 位作者的论文《SPADE: Self-Play in Adaptive Synthetic Executable Environments》让同一个大语言模型同时扮演两个角色:环境设计师把长程训练任务写成带 reset()/step() 接口的可执行 Python 代码(含状态转移、奖励函数与验证逻辑),推理智能体在这些环境里做强化学习;设计师以「有特权提示与无提示的回报差」(hint-based regret)为训练信号,使环境分布随智能体能力边界共同演化。在 Qwen3-30B-A3B-Instruct-2507 上,8 个留出基准均分从 50.2 提升到 58.3(+8.1),领先最强固定环境基线 5.3 分。论文于 2026 年 8 月 19 日提交 arXiv(v1,cs.CL)。这与本站此前介绍的《MidTool:工具使用需要专门的中间训练》形成对照:MidTool 是「买数据」(外部语料 mid-train),SPADE 是「自己造环境」(自生成可执行训练环境)。

In AI, LLM, 1 min read

AI 智创简报:《流式审核专利扎堆,给聊天产品装实时安检》

2026 年上半年「AI 系统内容审核」主题已有 4 件美国申请公开,Amazon 与 Intuit 的 2 件落在近 90 天。指向一致:生成式输出的安全审查要流式做、按块做。对做聊天产品的开发者,这是一层能接的活。

In AI, InnovationBrief, 1 min read

AI 智创简报:《PRD 生成专利公开,独立开发者能卖需求拆解活》

美国申请 US20260178323A1 于 2026 年 6 月 25 日公开:把一句产品想法交给大模型,自动生成完整的产品需求文档(PRD,Product Requirements Document)与用户故事拆解。vibe coding 上游的「一句话变结构化需求」这层工具,是一个独立开发者能接的活。

In AI, InnovationBrief, 1 min read

一分钟读论文:《测试时扩展:瓶颈在筛选,不在采样》

Thomson Reuters 的论文《Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck》是首个在不可精确验证的开放生成任务上对五类测试时扩展(TTS)方法做算力归一化对比的工作,结论是:瓶颈不在「生成更多候选」(探索有效),而在「从候选池里选出最终答案」(利用失效)。这与本站此前介绍的《LLM-as-a-Verifier》把验证当作缩放轴的系列不同——在开放生成任务上,验证器恰恰是失效环节。

In AI, LLM, 1 min read

一分钟读论文:《MidTool:工具使用需要专门的中间训练》

Snowflake、华盛顿大学和北卡罗来纳大学教堂山分校合作的论文《MidTool: Mid-training Data Synthesis for Agentic Tool Use》提出,智能体工具使用能力需要专门的 mid-training 数据管线,而不是只依赖 post-training。这与站内此前的《工具调用的苦涩教训》不同:那篇对比的是推理时方法(JSON 工具调用与程序化工具调用),本篇是训练数据管线的视角。论文于 2026 年 8 月 20 日提交 arXiv(v1,cs.AI),提交人 Fengqing Jiang,共 8 位作者。核心论点是:工具使用像数学和科学一样,需要专门的 mid-training 数据,而不是全靠 post-training。论文构建了 20.3B token 的 mid-training 语料 MidTool-Mix,在 Qwen3-4B-Base 与 Qwen3-8B-Base 上完成监督微调(SFT)与强化学习(RL)后,BFCLv3、tau2-Bench 与 MCP-Universe 三个基准一致提升。

In AI, LLM, 1 min read

一分钟读论文:《最佳选手未必是最佳教练》

加州大学伯克利分校哈斯商学院数据创新与人工智能实验室(DIAL)的论文《CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks》发现,大语言模型的”自动化”能力与”增强”能力几乎不相关:最会自己干活的”选手”,未必是最会指导别人干活的”教练”。论文用统一框架在 7 个真实工作任务上评测 9 个助手模型,每任务独立重复 10 次,两种角色排名的模型级 Spearman 相关仅 0.48(p=0.187),在常规显著性水平下与零不可区分。

In AI, LLM, 1 min read

一分钟读论文:《贝叶斯伙伴建模与 LLM 协同重规划》

论文《Bayesian Partner Modelling enables Adaptive Replanning for LLM Coordination》针对多智能体大语言模型系统的一个常见问题:队友会在任务中途切换策略,智能体却常常在公开证据表明伙伴已更换技能之后,仍继续执行过时的计划。现有方法要么把伙伴追踪当作被动上下文,知道变化发生但反应迟缓,要么不加区分地频繁重规划。论文提出 BayesBeliefAgent,将基于 GPT-4o 的分层大语言模型规划器与一个贝叶斯追踪模块配对,仅当伙伴的实际动作与推断技能直接矛盾时,才中断当前技能并触发重规划。除标准奖励外,论文以重规划效率与 belief-action gap 作为核心评估维度。

In AI, MultiAgent, 1 min read

AI 智创简报:《路由有专利,账单有水分:API 中间层省钱活》

2026 年大模型路由、语义缓存与成本预测主题的美国申请至少公开 6 件,其中 NVIDIA 与 IBM 的 2 件落在近 90 天。这些专利指向同一层:API 中间层。对交 API 账单的开发者,这是一层能接的活儿。

In AI, InnovationBrief, 1 min read

Featured