「长期愿景」共找到 846 篇相关文章
Gemini 2.5 Pro 是怎么炼成的?-- gemini 2.5 技术报告阅读笔记与思考
文章是 Gemini 2.5 技术报告阅读笔记。介绍其成功点有多模态、LongContext、思考能力;还阐述模型结构、训练和数据情况,以及代码、事实性、长上下文等特定能力的提升,最后提到基于其构建的智能体。
OpenAI首席科学家:发布前夜,我们差点砍掉ChatGPT!5个你不知道的惊险内幕。
文章分享OpenAI最新PodCast内幕。ChatGPT最初名又长又没记忆点,发布前夜高层因测试结果存争议。上线炸服,还曾因RLHF问题成“马屁精”。未来AI将向智能体化发展,招聘看重好奇心等能力。
无损加速视觉语言模型推理!轻松剪掉视觉冗余Token|腾讯AI Lab
多图像、长视频让大型视觉语言模型推理成本暴涨,成算力瓶颈。腾讯AI Lab联合CMU提出VScan,通过两阶段视觉token筛选机制,在几乎不损性能的前提下实现推理加速,且已在GitHub开源。
LeCun发布最新世界模型:首次实现16秒连贯场景预测,具身智能掌握第一视角!还打脸用了VAE
LeCun团队推出PEVA模型,让具身智能体学会人类“预判能力”,首次实现16秒连贯场景预测。它结合结构化动作表示与条件扩散Transformer,用真实数据训练,解决长时序问题,还能筛选最优动作。
百度开源文心4.5系列10款模型,多项评测结果超DeepSeek-V3
今日百度正式开源文心大模型4.5系列10款模型,涵盖不同参数规模。该系列模型在多文本和多模态基准测试达SOTA,多项评测超Qwen3、DeepSeek - V3,还具备三大关键创新,获开发者关注。
ChatGPT化身生活操作系统:奥特曼预告下一代顶级AI
在旧金山AI初创学校对话中,奥特曼宣布OpenAI计划发布强大开源模型,可本地运行。还谈到模型成本下降、ChatGPT记忆功能,以及GPT - 5等集成模型愿景,甚至称高级订阅将免费送机器人。
从文本到3D动画:AnimaX重新定义3D动作合成方式
北航与清华推出3D动画框架AnimaX,结合视频扩散模型运动先验与骨骼动画可控性,让任意骨架3D角色自然动起来。其核心方法灵活控制动作,虽有局限,但为3D动画创作打开新局面。
支付宝出手了,全民级的AI健康管家来了。
作者参加蚂蚁AI医疗产品发布会,介绍了全新AI产品AQ。它是专门的AI健康助手,免费用,能精准定位病因,还可预约挂号,与医保打通,有健康档案等功能,打破医疗信息差,未来可期。
谷歌AlphaGenome横空出世!40亿年生命代码一键破解,或再夺诺奖
谷歌DeepMind发布AlphaGenome,可一次读取100万个DNA碱基,预测基因突变。它以长DNA序列为输入,预测数千种分子特性,克服了现有模型在序列长度和分辨率间的取舍问题,有望推动生物学研究和新疗法诞生。
哈工大发布动画多智能体,文本一键生成连贯动画
随着多模态模型兴起,AI生成叙事性视频成热点,但现有方法处理长视频有挑战。哈工大发布AniMaker框架,由多个智能体协作,实现文本到动画自动化转换,解决了视觉连贯和叙事一致等问题。