「锚点验证框架」共找到 2334 篇相关文章
GLM-5正式发布,744B参数,对标Claude
GLM-5正式发布,对标Claude,参数从355B扩至744B,预训练数据增加。采用GlmMoeDsa架构,部署成本降低。数据表现佳,在多测试中成绩亮眼,还能直输Office文档,部署支持多框架和国产芯片,早期反馈积极。
上交大智能计算研究院论文:不只算对答案,大模型如何真正学会运筹建模丨ICLR 2026
上海交大智能计算研究院提出 StepORLM,通过生成式过程监督提升运筹建模可靠性。研究反思传统训练范式局限,在多数据集测试中,小参数的 StepORLM 表现超大型模型,还分析现有方法缺陷并提出解决框架,有重要方法论和应用意义。
中科大校友,谷歌量子处理器总监 Yu Chen 揭秘Willow量子芯片背后的“秘诀”
谷歌量子AI团队宣布“Willow”量子芯片运行“量子回声”算法,实现可验证量子优势。中科大校友、谷歌量子处理器总监Yu Chen揭秘其“秘诀”,芯片关键性能指标高,让算法运行速度提升13000倍,谷歌正迈向量子计算路线图“里程碑3”。
一个「流浪」数学家的遗产,正在被AI公司疯抢
2026年,OpenAI等公司用AI解决多个匈牙利数学家Paul Erdős提出的问题,震动数学界。这些问题分布广、难度跨度大,适合模型测试。不过,AI证明的验证和人类数学家地位受关注。
Fable 5解禁即翻车!写一行代码就降智,开发者破防
消失19天的Fable 5解禁即翻车,因过度审查和双标机制,让开发者破防。但抛开护栏,它执行复杂任务能力强。A社同期发布的Sonnet 5也遭群嘲,此外,A社还提出评估框架并向政府让步。
Skills驱动推理新范式,清华&北大:Token立省59%,准确率不降反升
当前推理模型虽准确率高,但生成“思考过程”会使推理成本和延迟上升。奇元科技、清华、北大等提出TRS框架,将历史推理轨迹蒸馏成技能卡片,在推理时检索注入,实现更少Token、更高准确率。
Claude半个月连崩7次!全球宕机3小时,强制实名精准封号
Claude半个月内7次大规模故障,全球宕机3小时,开发者破防。原因是Anthropic算力储备告急,为自救拟自研芯片。此外,Anthropic还通过改定价、加闸、实名验证等措施控制成本。
视频生成Prompt何须仅是文字!字节&港中文发布Video-As-Prompt
AI视频生成中,依赖抽象语义控制的创作因缺乏统一条件表征而困难。字节与港中文团队提出Video - As - Prompt框架,引入‘视频参考’范式,实现抽象语义下可控视频生成范式统一,代码和数据集已开源。
单条演示即可抓取一切:北大团队突破通用抓取,适配所有灵巧手本体
在灵巧手通用抓取研究中,传统强化学习面临挑战。北大及BeingBeyond团队提出DemoGrasp框架,以一次成功抓取演示轨迹为起点,通过编辑轨迹适应不同物体与姿态,提升学习效率和真机性能,实验效果出色。
大模型终于能“听懂”云操作了?
本文介绍通过MCP Server和大模型结合实现云产品管理的自然语言操作。作者分享上手体验、探究原理、进行代码验证,解决使用问题,还提出后续优化方向和未来展望,如拆分MCP Server、建立云产品Agent等。