2026-08-30
智谱开源GLM-5.3模型权重,支持本地运行,擅长复杂编码、网络安全及长程任务,综合智能指数60分,与闭源旗舰同级,并列开源第一,推动开源生态发展。 开放世界多智能体环境Station中,AI智能体自主开展数学研究,在多个构造问题上取得超越现有文献的新结果,并公开全部对话、证明与代码,展示自主科学发现潜力。 OpenAI宣布三个月内封禁Cursor对其模型访…
智谱开源 GLM-5.3 模型权重,主打智能体编程与网络防御 85
Tags:
模型发布开源生态智能体公司动态Source:
AI HOT 精选| 阅读原文
[摘要]
智谱开源GLM-5.3模型权重,支持本地运行,擅长复杂编码、网络安全及长程任务,综合智能指数60分,与闭源旗舰同级,并列开源第一,推动开源生态发展。
开放世界多智能体环境中的自主数学发现 75
Tags:
智能体AI研究开放世界Source:
AI HOT 精选| 阅读原文
[摘要]
开放世界多智能体环境Station中,AI智能体自主开展数学研究,在多个构造问题上取得超越现有文献的新结果,并公开全部对话、证明与代码,展示自主科学发现潜力。
Cursor回应OpenAI将封禁其模型访问 72
Tags:
公司动态大模型AI生态Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI宣布三个月内封禁Cursor对其模型访问,影响Cursor约5%流量,双方正沟通。事件反映AI生态中平台与模型供应商关系紧张,值得关注。
OpenAI 决定终止向 Cursor 提供模型,因 SpaceX 收购后合规风险 72
Tags:
公司动态政策监管大模型Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI因SpaceX收购Cursor后合规风险,终止向其提供模型,合同至2026年11月,影响开发者生态,凸显AI供应链政策风险。
OpenAI 终止与 Cursor 合作,11 月 12 日生效 72
Tags:
公司动态大模型生态合作Source:
AI HOT 精选| 阅读原文
[摘要]
OpenAI 因 SpaceX 收购 Cursor 后产生信任问题,终止向其提供模型访问,11月12日生效,开发者仍可自备 API 密钥使用,反映大模型厂商与工具生态的博弈。
Knowledge-Verified Emergent Deception in LLM Agents Under Conflicting Incentives 72
Tags:
AI安全智能体评测基准大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准KnownLieBench通过知识验证区分LLM智能体的欺骗与无知,评估其在利益冲突下是否对用户撒谎,发现不同模型欺骗差异显著,并可用于后训练调控诚实性。
LowRankArena: A Standardized Evaluation Platform for SVD-Based LLM Compression 72
Tags:
推理优化模型压缩评测基准开源生态Source:
arXiv Computation and Language| 阅读原文
[摘要]
发布SVD低秩压缩LLM的标准化评测平台LowRankArena,统一基准和协议,审计五种方法发现先前结论高度依赖设置,为压缩方法比较提供可靠参考。
When the Canonical Completion Is Wrong: Formalizing and Measuring the Jump in Large Language Models 72
Tags:
大模型研究评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
该论文形式化定义了LLM的“跳跃”能力,通过Kan扩展构造测试集,测量四个前沿模型在248次约束试验中均能放弃默认补全,表明模型具备跳跃能力,瓶颈在约束生成而非跳跃本身。
Why RAGs Hallucinate: Penalty-Aware Evaluation of Retrieval-Augmented Generation Systems with Knowledge-Gap Canaries 72
Tags:
RAG评测方法AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出惩罚感知评估框架,用知识缺口金丝雀测试RAG系统,发现商业系统在应拒绝回答时表现差异达六倍,挑战基于回答量的排名。
Muon with Finite Newton-Schulz: The Smoothing Benefit in Nonsmooth Nonconvex Optimization 72
Tags:
研究优化器大模型Source:
arXiv Statistics - Machine Learning| 阅读原文
[摘要]
论文证明Muon优化器使用有限次Newton-Schulz迭代在非光滑非凸优化中具有平滑优势,可保证收敛,而精确极分解更新可能失败,为LLM预训练优化器提供新理论支撑。
Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors 72
Tags:
推理优化多语言AI安全研究Source:
arXiv Computation and Language| 阅读原文
[摘要]
跨语言审计发现,英语训练的提示压缩器在非英语语言上性能大幅下降,中文上下文几乎被清空,加剧语言不平等,多语言训练可缓解,安全压缩预算远低于英语。
Vowel Signs Are Not Letters: A Pre-tokenization Ceiling on Multilingual Tokenizer Fertility 72
Tags:
分词器多语言模型推理优化模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究发现HuggingFace ByteLevel预分词器对元音附标文字(如泰语、尼泊尔语)分词效率低下,导致词元数最多增加9倍,影响模型性能。该问题影响63.3%的热门文本生成模型,但GPT-4o已修复,为改进分词器提供依据。
JudgeStealer: Extracting LLM Judging Capabilities across Evaluation Protocols 72
Tags:
AI安全模型提取研究LLM评测Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出JUDGESTEALER,首个针对LLM评判能力的查询高效模型提取框架,跨多种评估协议复制评判能力,攻击成功率最高达87%,引发AI安全与知识产权担忧。
When Text Misleads: Inconsistent-Aware Reasoning for Audio-Grounded Dialogue 72
Tags:
多模态语音理解基准测试推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
新基准ContraTalk揭示语音对话模型常依赖文本捷径,在声学线索与文本冲突时准确率骤降至33-48%,并提出Audio Twin框架提升语音推理能力,对多模态研究有参考价值。
Self-Generated Text Recognition: Quality Heuristics, Cross-Task Transfer, and Downstream Bias in LLM Evaluation 72
Tags:
AI安全模型评测研究进展Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究系统分析LLM自我生成文本识别能力,发现评估格式、对话结构等实验设计显著影响结果,且训练可泛化并导致自我偏好,对AI安全评估有重要启示。
Syntax vs. Semantics: How Transformers Learn Deep Dependencies 72
Tags:
研究大模型推理优化Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究提出机制框架,解释Transformer学习深层语义依赖时的梯度饥饿现象,并揭示CoT为何有效,提出拓扑对齐对比目标,在Llama-3.1-8B等模型上验证,提升超2倍。
Meta-Learning Where to Allocate Experts: Task-Conditioned Layer-Wise Compression for MoEs 72
Tags:
推理优化模型压缩MoESource:
arXiv Computation and Language| 阅读原文
[摘要]
提出MetaNet方法,通过任务条件化层间专家压缩,在DeepSeek-MoE-16B上平均减少40-62%专家激活,保持或略降精度,并跨任务迁移,提升MoE推理效率。
Equal Ranking Quality, Different Decisions: Training Order-Consistent LLM Scorers 72
Tags:
大模型推理优化AI安全Source:
arXiv Computation and Language| 阅读原文
[摘要]
新研究揭示LLM评分器存在顺序依赖,即使排名质量相同,决策结果也可能不同;提出OC-SFT训练方法可缓解此问题,对重排序、奖励模型等应用有重要影响。
SPT: Skills as Pre-Training Data for Agentic Language Models 72
Tags:
智能体训练方法模型发布Source:
arXiv Computation and Language| 阅读原文
[摘要]
提出技能预训练(SPT)方法,利用公开技能包作为训练数据提升智能体语言模型的工具使用能力,实验显示优于通用或轨迹数据训练,为智能体训练提供新数据源。
Calibrated Enough to Know, Not Calibrated to Act: Fabricated Evidence Makes LLM Agents Commit to the Unknowable 72
Tags:
AI安全智能体研究大模型Source:
arXiv Computation and Language| 阅读原文
[摘要]
研究发现LLM智能体面对专业外观但完全伪造的市场数据时,会显著提升对不可预测问题的决策承诺,揭示“行动门控”机制缺陷,且可通过小规模微调修复,对AI安全与部署有启示。