「可验证推理」共找到 6064 篇相关文章
一种基于滑动层合并的高效深度修剪大模型的方法
文章指出深度修剪可加快推理速度,但直接丢层会降低性能。为此提出滑动层合并法,根据相似度阈值融合连续层,简化结构且保持性能。实验显示该方法优于现有技术,还揭示了与宽度修剪结合的潜力。
腾讯混元开源 4 个小尺寸模型,主打 Agent 和长文
8月4日,腾讯混元开源四款小尺寸模型,参数为0.5B、1.8B、4B、7B,消费级显卡可运行,适用于低功耗场景。模型具备推理快、性价比高特点,亮点是Agent和长文能力,已在腾讯多业务应用。
万亿思考模型新速度!蚂蚁开源Ring-2.5-1T:IMO金牌水平,强;混合线性架构,快!
蚂蚁集团发布全球首个开源混合线性架构万亿参数模型Ring - 2.5 - 1T,打破深度思考牺牲推理速度和显存的‘不可能三角’。还同期发布扩散语言模型LLaDA2.1和全模态大模型Ming - flash - omni - 2.0,想做成可复用底座。
万亿级思考模型,蚂蚁首次开源!20万亿token搅局开源AI
10月14日蚂蚁集团发布万亿参数思考模型Ring-1T,在多领域表现出色,推理能力直逼闭源巨头。此前已开源旗舰通用大模型Ling-1T。还介绍了训练技术创新,虽模型有不足,但开源夺冠证明‘思考力’可工程化。
30分钟轻松掌握Cursor,快速提升开发效率和体验
本文通过在WebX老项目实践,验证Cursor用AI大模型能高效生成符合老旧项目规范的代码框架,显著提升开发效率与体验。还介绍其页面区域、AI聊天区功能,通过实战演示展示提效过程,最后提及可与MCP结合及OpenAI开源模型部署方案。
阿里云Tair KVCache仿真分析:高精度的计算和缓存模拟设计与实现
阿里云Tair KVCache团队推出Tair - KVCache - HiSim,这是面向分布式多级KVCache管理的高保真LLM推理仿真分析工具。它能在通用CPU上高精度预测性能,支撑计算选型、存储规划和调度协同等决策,还介绍了其架构、组件、验证及性能评估等内容。
AI证伪百年数学猜想被打假!Lean证明惊现漏洞,哥大教授破防了
OpenAI新推理模型取得十项数学进展,如证明非Sofic群存在性等。哥伦比亚大学副教授Henry Yuen对其量子并行重复定理证明既兴奋又失望,因证明有AI味且难理解。此外,Lean证伪科拉兹猜想被指利用内核漏洞,专家提醒Lean验证有局限。
港中文 MMlab×美团新研究:仅用一个模型,应对多种视觉推理任务
港中文 MMLab 与美团联合提出 OneThinker 多模态统一推理模型,将多种视觉任务抽象为‘先推理、后作答’形式,通过多任务强化学习优化。实验显示其在多任务表现佳,为通用视觉推理模型提供参考。
顶尖数学家含泪退圈:熬了多年的博士难题,被AI几周秒杀!
顶尖数学学者Rishikesh Gajjala靠AI攻破博士课题,却宣布退出学术圈。他认为AI生成证明虽精巧但难验证,“漂亮证明未验证和垃圾无异”。他投身形式化验证领域,而AxiomProver完成“246定理”形式化验证。
清华校友出手,8B硬刚GPT-4o!单一模型无限工具调用,终结多智能体
MIT等机构推出TIM和TIMRUN组合拳,突破模型token天花板。TIM将推理建模为任务树,TIMRUN优化内存管理。二者结合支持长程推理,实现单模型高效推理,简化智能体构建,在多方面表现出色。