「数学理论研究」共找到 2269 篇相关文章
红杉中国推出 Agent 基准测试「xbench」,双轨评估体系,关注 AI 真实场景的效用
红杉中国开放AI和Agent基准测试工具「xbench」,采用双轨评估体系,构建多维度测评数据集。首期发布两个核心评估集并排名,提出垂类Agent评测方法论。该工具旨在解决现有评估问题,关注AI真实场景效用。
博士宿舍激情脑暴,革新了Scaling Law?Qwen和浙大联手推出新定律,直接干掉95.5%推理内存!
近日,阿里与浙大合作提出并行计算缩放定律 ParScale,可在不增参数下提升大模型能力,推理效率更高。它通过引入并行流实现,在数学、编程等任务表现佳,适合边缘设备,代码已开源。
图文跨模态“近视”问题破局:360开源新模型 FG-CLIP,实现细粒度图文对齐突破|ICML2025
360人工智能研究院发布 FG - CLIP 模型,攻克图文细粒度对齐难题,成果被 ICML 2025 接收并开源。它采用双阶段训练等策略,在多任务评测中超越对比模型,推动跨模态研究产业化落地。
李飞飞最新播客:AI 是一项文明级技术,以人为本是关键
AI教母李飞飞在High Signal播客指出AI是文明级技术,分享构建以人为本AI的见解,涵盖研究动机、好奇心作用、AI同心圆层级等话题,还强调空间智能重要性,给出AI发展建议。
AI重塑搜索:夸克“深度搜索”如何定义下一代信息入口|甲子光年
大模型发展推动搜索产品革新,“搜索”变“深度搜索”。夸克升级AI超级框发布“深度搜索”,即将推出“深度搜索Pro”。其“深度搜索”情商高,“深度搜索Pro”免费、快速、专业,夸克正打造AI全能助手。
他们想用AI发现不存在的物理学,然后用它去半人马座
美国初创公司 Physical Superintelligence(PSI),计划用 AI 加速物理发现。其核心平台 Emmy 能拆解研究问题。商业应用从 AI 数据中心切入,还参与费米探索者星际探测任务,目标平衡学术与商业。
首次曝光!OpenAI新一代旗舰Astra换上“循环深度”推理架构:用计算深度换参数规模
9月2日消息,OpenAI将推出的旗舰模型Astra采用“循环深度”新技术,用较小模型实现庞大模型性能,降低成本。但该技术会让AI推理过程不可读,加重安全担忧,此前奥特曼已因Astra“能力过强”踩刹车。
2个设置,让Codex体验翻倍
文章分享两个提升Codex使用体验的技巧。一是在config.toml里添加配置,让非计划模式能主动提问;二是用特定提示词测试gpt的juice值,选正常思考程度的模型使用,提升使用心情。
西交大提出QQWorld:仅需10行代码,世界模型成功率提升5.33个百分点
2026 年 3 月 Yann LeCun 等人提出 LeWorldModel,西安交通大学研究团队发现其存在问题,进而提出 QQWorld,用分位数—分位数匹配替换原有的 EP 正则,提升了规划成功率,还提出 Cross - Batch QQ 解决显存问题。
强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升
人大高瓴研究团队提出DelTA算法,不依赖经验为强化学习目标中每个token算最优权重。实验显示它适配主流强化框架,在多任务上提升base模型效果,还能让训练更稳定。