2025年7篇AI顶刊论文一文看懂:每周机器学习论文精选项目速览
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
每天 arXiv 上百篇新论文,没人能全读完。AI Papers of the Week 是 DAIR.AI 团队维护的开源项目,每周精选机器学习领域最值得读的论文,配一段大白话摘要,按年份和周次归档。本期(2025年6月23日-29日)收录 7 篇,覆盖扩散语言模型的超高速推理、智能体内存优化、罕见病诊断等方向,适合想快速对齐前沿的开发者。
仓库里有什么:三年每周论文精选日志
仓库定位很直白:一份持续更新的"每周论文清单"。维护方 DAIR.AI 每周从新论文中挑出最有分量的,每条都给出链接和要点描述,不点开原文也能知道论文在解决什么问题。内容按年份从 2023 年排到 2026 年,每周固定收录 10 篇。
- README.md:总索引,按年份列出全部周条目并带锚点,可直接跳到任意一周
- years/:每年一个文件(2023.md 至 2026.md),存放每周的论文表格
- pics/:每周精选论文的图片拼贴,方便回看重点论文的图示
- research/:结构化数据,如 ml-potw-10232023.csv,含历史论文标题、描述和链接
本地浏览只需克隆仓库:
git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week本期看点:7 篇论文横跨推理速度与垂直落地
| 论文 | 方向 | 一句话亮点 |
|---|---|---|
| Mercury(扩散语言模型) | 代码生成推理加速 | 并行生成多令牌,H100 上最高 1109 tokens/sec,快 10 倍 |
| MEM1 | 智能体内存优化 | 长序列内存恒定,省 3.7 倍内存,7B 打赢 14B 基线 |
| Towards AI Search Paradigm | 多智能体搜索 | 四智能体分工 + DAG 任务规划 + MCP 动态选工具 |
| RLT(强化学习教师) | RL 训练与蒸馏 | 7B 教师生成解释,超 32B+ 蒸馏管线 |
| DeepRare | 罕见病诊断 | 6401 例评测,1013 种疾病准确率 100% |
| AlphaGenome | 基因调控预测 | 单碱基分辨率覆盖百万碱基对 |
| Claude for Affective Use | 用户行为研究 | 450 万次对话,仅 2.9% 是情感支持 |
图:项目每周精选论文配图拼贴(数据来源:pics/Week-2.png)
逐篇拆解:推理加速、智能体系统与垂直领域
推理、内存与训练效率:让大模型跑得起
Mercury(Ultra-Fast Diffusion-based Language Models)
代码补全慢,根子在自回归模型一次只能吐一个令牌。Mercury 换成扩散语言模型:先生成粗糙草稿,再并行细修,一次产出多个令牌,同时保留 Transformer 架构,现有 LLM 基础设施可直接复用。H100 上 Coder Mini 和 Small 分别跑到 1109 和 737 tokens/sec,比速度优化的前沿模型快最多 10 倍;HumanEval、MBPP 等基准与 Claude 3.5 Haiku、Gemini 2.0 Flash Lite 打平;FIM 代码补全超越 Codestral 2501 和 GPT-4o Mini;Copilot Arena 里 Mini 以 25ms 延迟拿到第二的 Elo。
MEM1
先说结果:16 目标多跳 QA 上,7B 的 MEM1 打赢 Qwen2.5-14B-Instruct,内存少 3.7 倍,推理快 1.78 倍。传统智能体把每轮的想法、动作、观察都追加进上下文,序列越长内存越爆;MEM1 只维护一个共享内部状态( ),每轮更新并丢弃旧上下文,内存几乎恒定,用 PPO 式 RL 端到端训练。内部状态分析显示它自发形成了结构化内存管理、选择性注意和查询重构等策略,接近人类记忆的使用方式。
Reinforcement-Learned Teachers(RLT)
对比对象有点反常识:7B 的教师模型,解释质量超过 32B+ 的蒸馏管线(含 DeepSeek R1、QwQ)。关键在任务定义——RLT 不学解题,而是拿着已知的问题和答案,学写"学生模型看得懂"的解释,奖励来自学生能否据此复现正确答案、解释本身是否逻辑自洽。这绕开了传统 RL 的探索难题:训练只要 125 步、1 个 epoch、无需后处理;AIME、MATH、GPQA 上学生表现更好,还能零样本迁移到算数游戏等新领域。
从搜索到诊断:多智能体系统的工程实践 🔍
Towards AI Search Paradigm
相比传统 RAG"先检索再写",这套系统把活拆给四个智能体:Master 解析请求,Planner 把任务分解成 DAG 并可在失败时局部重规划,Executor 调用搜索、计算器等工具,Writer 汇总中间产出成最终答案。两处设计值得注意:用 MCP 协议服务器动态挑选与查询语义相关的小工具子集,而不是把所有工具塞给模型;用 RankGPT 和 TourRank 让搜索结果对齐 LLM 偏好,Writer 再经对抗调优抵抗噪声检索。这种"分解-规划-执行-写作"的流程,是复杂信息合成任务的参考模板。
图:往期周精选论文配图,展示提示词优化与问答生成的工具调用示例(数据来源:pics/Week-6-12-February-2023.png)
DeepRare
罕见病诊断的难点是证据长尾且多模态:医生要在表型、变异、文献之间反复比对。DeepRare 搭了一套三层 MCP 风格智能体架构:中央 LLM 主机负责记忆与调度,专业智能体做表型提取和变异优先级排序,背后接 40+ 医疗工具和网络级医学源,推理链可追溯到可验证的医学出处。6401 个病例、2919 种疾病上,1013 种疾病准确率 100%,Recall@1 达 57.18%,比 Claude-3.7-Sonnet-thinking 高 23.79%(仅 HPO 评测);109 例全外显子测序达到 70.60% Recall@1,Exomiser 为 53.20%;180 条推理链的专家评审一致率 95.4%。
生物与社会观察:从基因组到对话记录 💬
AlphaGenome
第一个把"上下文长度"和"分辨率"同时解决的序列模型:卷积 + Transformer 层以单碱基分辨率建模多达 100 万个 DNA 碱基对,一次前向同时预测基因起止点、RNA 表达、剪接、染色质可及性和蛋白结合,计算量只有 Enformer 的一半。对比野生型与突变序列的预测,就能评估单个突变的调控影响;它还首次显式预测 RNA 剪接位点位置及表达水平,对脊髓性肌萎缩症、囊性纤维化这类疾病研究很实用。22/24 单序列基准、24/26 变异效应基准上均领先。
Claude for Affective Use
这是一篇实证研究而非方法论文,但样本量足够大:Anthropic 分析了 450 万次 Claude 对话,筛出 13.1 万条情感支持类(人际建议、辅导、咨询、陪伴,排除了短对话和任务型)。结论:仅 2.9% 的对话属于情感支持,浪漫/性角色扮演不足 0.1%;不到 10% 的情感对话中 Claude 会拒绝请求,主要是劝阻伤害性行为或说明专业边界;情感分析显示用户会话结束时情绪更积极。作者也提醒,单次会话的语言分析不代表长期心理影响。这份数据为 AI 情感交互设计提供了首批大规模实证依据。
图:往期周精选论文配图,展示"小模型训练 + 大模型推理"的 UPRISE 架构(数据来源:pics/Week-Mar-13-Mar-19-2023.png)
怎么用起来:持续更新与配套资源
- 持续获取更新:仓库每周新增一个周条目,打开 README.md 看最新一期即可,SUMMARY.md 提供目录总览;不想克隆的话直接在平台上按年份翻也行
- 配套资源:research/ 目录的 CSV 把历史论文以结构化形式导出,适合批量导入自己的论文订阅流;维护方还有 newsletter 订阅和 Discord 社区,可以收到每周推送并参与讨论
- 适合谁:适合想跟踪趋势又不想读完全部原文的开发者、学生;领域研究者可以把它当"目录",快速定位值得精读的论文
趋势研判:本期选出的三个信号
- 扩散生成正在挑战自回归的速度优势:并行多令牌生成加上现成的 Transformer 基础设施复用,推理速度首次成为可以量化的卖点(如扩散语言模型推理速度)。
- 智能体研究从"能跑通"转向"跑得省":恒定内存、DAG 重规划、动态工具子集选择,都在回应长序列多轮任务的工程成本。
- 垂直领域开始给出可验证、可追溯的结果:罕见病诊断和基因变异解读都强调推理链能回溯到权威来源,可解释性正变成医疗 AI 的硬指标。
下期可以看 2025 年 7 月的精选,想追踪某类论文也可以留言告诉我方向。
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考