今日 RSS 精选 — 2026-09-03
今日 RSS 精选 — 2026 09 03 🧠 AI 训练与推理优化 OPSA:无教师蒸馏在 AIME24 上提升 35.41 分 on policy distillation(OPD)中,大教师模型的评分反而随规模增大引入更多噪声;OPSA 抛弃教师监督,在高熵位置施加固定负优势值,抑制尾部 token 并重新分配头部概率。Qwen3 1.7B 在 A
今日 RSS 精选 — 2026-09-03
🧠 AI 训练与推理优化
OPSA:无教师蒸馏在 AIME24 上提升 35.41 分
on-policy distillation(OPD)中,大教师模型的评分反而随规模增大引入更多噪声;OPSA 抛弃教师监督,在高熵位置施加固定负优势值,抑制尾部 token 并重新分配头部概率。Qwen3-1.7B 在 Avg@32 上相对增幅 263%,且领先 OPD 16.77 分。提醒训练团队:密集 token 级反馈不天然比稀疏奖励可靠,部署前应量化教师在学生轨迹上的判断质量。
- 原文:https://ai-brief.liziran.com/zh/daily/2026-09-03-opsa-teacher-free-distillation.html
模型识别出“无解”却拒不拒答
从 1.7B 到 70B 多种指令模型的隐藏状态中,存在一条能线性区分“可回答”与“结构性无解”的方向,但该方向与安全训练形成的拒答方向近乎正交。说明模型“看懂了却不按套路走”,断点在预训练期已形成,单纯加拒答样本修不补。工程上应排查识别信号到响应策略的路由机制,而非默认知识不足。
- 原文:https://ai-brief.liziran.com/zh/daily/2026-09-01-recognition-refusal-visual-reasoning.html
世界模型需匹配“未来出现概率”,而非只生成单条合理轨迹
PAWBench 在 50 个场景对 11 个系统重复采样,发现没有模型能同时覆盖多种有效行为并匹配参考概率分布。PAWEval 把多次生成转为经验概率,把评测单位从“视频像不像真”升级为“概率结构对不对”。同理,UrbanGround 用香港全域 3D 沙盒揭示:静态街景识别好 ≠ 连续导航行,方向判断、避让行人、长距离探索在证据失效后仍不可靠。
- 原文:https://ai-brief.liziran.com/zh/daily/2026-08-30-probabilistic-world-models-urban-agents-es.html
🤖 AI Agent 与多智能体系统
Gemini 3.8 Flash 发布:定位“全能主力”,主打软件工程与自主 Agent
六周内连发三代 Flash,3.8 在长流程编码、复杂推理、网络安全攻防上实现跨越式提升,保持低成本高速度。适合作为需要大量工具调用、多步骤深度推理的 Agent 主力模型。
- 原文:https://best.xiaohu.ai/article/google-gemini-3-8-flash-cyber/
Anthropic 开源可运行的 AI 电商 Agents 参考实现
包含 Shopping Agent、Merchant Agent、10 个 Skills、4 个行业示例、3 种运行方式,演示业务工具、呈现组件、记忆、安全审批与评测的完整落地。可直接作生产级 Agent 架构参考。
- 原文:https://best.xiaohu.ai/article/claude-commerce-agents/
MIT 开源 Reef:让推理服务器负责 Agent 持续学习与自我改进
线上请求留下可归因经验 → Recipe 生成模型或 Harness 候选 → 评测与版本链决定哪些变化进入下一轮服务。把“推理服务”升级为“持续进化的数据飞轮”,解决 Agent 落地后如何不退化、如何从真实流量中低成本迭代的工程难题。
- 原文:https://best.xiaohu.ai/article/reef-continual-self-improving-agents/
Agent 群聊:基础设施已成熟,协作机制成瓶颈
AgentScope 团队用 Kubernetes CRD 管理 Worker/Team/Manager,Higress 托管密钥,Matrix 协议作通信总线,MinIO 提供共享存储,解决了凭据安全、可观测、人在环、多运行时兼容。但结构仍是 Manager-Workers,缺方案共同讨论、OKR 协商、分歧仲裁、复盘沉淀。跨领域协作(空间注意力分散)与长链路工作流(时间注意力衰减)是引入群聊的两大核心场景,五种基本组织形态无银弹,需按任务选型。
- 原文:https://qiankunli.github.io/2026/07/01/agent_team.html
⚙️ 基础设施与工程实践
你需要知道的 AI 缓存知识:命中价格仅为未命中 1/50
DeepSeek V4 Flash 缓存命中输入仅 2 分钱,未命中 1 元。缓存保存时间:Anthropic 5 min、DeepSeek 10 min、OpenAI 10–30 min 渐失效、Google 1 小时内渐失效。Agent 保持缓存激活的最佳实践:每 4 分钟自动发一次激活请求(而非常见的 30 秒),平衡费用与命中率。多轮对话、长程任务的成本优化核心在于前缀复用。
- 原文:http://www.ruanyifeng.com/blog/2026/08/weekly-issue-408.html
Wordfence CLI + Vectorscan:PHP 网站后门排查实战
Debian 13 无 libpcre3 依赖,改用 apt install libvectorscan5(Debian 11 用 libhyperscan5)。Vectorscan 扫描速度比 PCRE 快几十倍,支持 YARA 规则、并行扫描、管道输入输出。二进制下载即用,无需 venv,适合 CI/CD 集成与定时巡检。
- 原文:https://lala.im/10314.html
十分钟用 Docker Compose 搭建 Obsidian 私有同步服务
Fast Note Sync 支持多端实时同步笔记与附件,自托管、数据完全可控、无第三方依赖。适合追求隐私、离线优先、跨平台同步的知识管理流程。
- 原文:https://iwanlab.com/docker-compose-install-fast-note-sync/
🔬 理论与前沿探索
LLM 与自我指涉
Scott Aaronson 探讨大模型处理自我指涉陈述(如“这句话是假的”)的能力边界,涉及逻辑一致性、元认知与对齐的深层关联。对研究模型推理极限、设计鲁棒评测基准有启发。
- 原文:https://scottaaronson.blog/?p=10046