「新注意力机制」共找到 4357 篇相关文章
小扎开9位数薪酬新建AI团队!砸千亿收购华人初创公司,Llama 4太拉胯急坏了
Meta CEO扎克伯格对Llama 4表现失望,一边开7 - 9位数薪酬从谷歌、OpenAI等公司挖人组建新AI实验室,另一边豪掷148亿美元收购初创公司Scale AI 49%股份并挖来CEO,Llama 4在第三方测试中表现不佳。
强化学习之父:LLM主导只是暂时,扩展计算才是正解
新晋图灵奖得主、强化学习之父Richard Sutton在新加坡国立大学演讲时预测,大模型主导是暂时的,未来五年甚至十年内不是技术前沿。他认为AI应从依赖人类数据转向体验学习,强化学习潜力需靠扩展计算支撑。
阿里Qwen3一口气开源多个向量&排序模型,冲!
今天阿里正式开源Qwen3-Embedding和Qwen3-Reranker系列,为多语言文本嵌入和相关性排序树立新标杆。提供0.6B/4B/8B三种版本,支持119种语言,在多个数据集达先进性能,赋能多种应用场景。
苹果拆解AI大脑,推理模型全是「装」的?Bengio兄弟合著
苹果最新研究揭示大推理模型(LRM)在高复杂度任务中普遍‘推理崩溃’。即便给予明确算法提示,模型亦无法稳定执行,暴露推理机制的局限性。研究还通过多种实验环境分析了模型在不同复杂度问题中的表现。
Cursor迎来史诗级更新,关于Cursor 1.0.0版本,这里有你需要知道的一切!
2025年6月5日,上线2年的Cursor迎来首个正式版1.0.0。此次更新功能多且关键,如上线代码审查工具Bugbot、全面开放后台代理功能等,虽提升了开发效率,但部分功能有使用成本,对新手不太友好。
推理能力大比拼,《推理模型综合测评报告 2025 》正式发布
过去半年,推理能力成大模型新分水岭。InfoQ研究中心评测八款热门模型,围绕五大维度,用超90%原创试题。发现各模型在不同维度表现有差异,推理模型发展正从‘一个大脑’变为‘带工具的多能智能体’。
原来Veo 3早有苗头!人大联合值得买科技在CVPR 2025提出全新「图像到有声视频」生成框架
中国人民大学与值得买科技团队在CVPR 2025提出JointDiT框架,可从静态图像生成同步音视频。此研究定义图像到有声视频生成新任务,解决音视频融合难题,实验显示其效果优,还将拓展至四模态建模。
GPT-6 Astra搓3D刷屏后,3D生成的竞争规则变了
GPT-6 Astra靠Agent一键生成3D内容刷屏后,引发通用大模型是否会取代专业3D生成模型的讨论。本文实测影眸Hyper3D新上线的Agentic Mode,分析3D行业在Agent时代的全新竞争标准。
Google 发布 Gemini 3.8 Flash:6 周内第 3 次升级
Google DeepMind 官宣发布 Gemini 3.8 Flash 和 3.8 Flash Cyber 两个新模型。3.8 Flash 在软件工程等方面有显著提升,跑分成绩亮眼,价格实惠,性价比高;3.8 Flash Cyber 面向网络安全场景。目前 3.8 Flash 已在多平台上线。
当 AI 开始重写负载,数据库该如何重新设计?
AI正改写数据库命题,新数据对象进入生产链路,AI Agent带来更复杂任务链路。在腾讯云数据库DBTalk上,三位研究员从不同方向探讨当负载被AI改写,数据库该如何重新设计,包括内核优化、资源管理和测试测评等方面。