新注意力机制」共找到 4312 篇相关文章

新闻资讯8

大模型的进化方向:Words to Worlds | 对话商汤林达华

量子位对话商汤林达华,探讨大模型发展。商汤的SenseNova - SI超越李飞飞团队模型,林达华认为单纯依赖参数规模的AI范式遇瓶颈,商汤推出NEO架构革,还在落地应用优化,为年轻人指明赛道。

量子位
新闻资讯7

任IEEE Fellow要来参加雷锋网GAIR大会啦!

2026年IEEE晋Fellow名单公布,348位学者入选,其中华人126位,AI领域42位。付昊桓等学者研究聚焦高性能计算等领域,付昊桓将在12月12日GAIR大会演讲。IEEE Fellow是学会最高荣誉,当选者贡献重大。

AI科技评论
产品应用8

AI时代的天工开物:分子之心掀起生物经济“操作系统”革命 | 甲子光年

生物经济正迈向工程化时代,分子之心作为AI蛋白质设计领军企业,携核心产品MoleculeOS入驻礼来上海创孵化器。该平台升级后能力强大,还在构建生物经济‘基建’,解决产业难题。

甲子光年
算法论文8

LightMem用3招重设计了LLM的记忆,结果出乎意料

LLM在超长多轮对话中有上下文窗口有限、记忆系统昂贵的痛点。LightMem借鉴人类记忆机制,用三招重设计LLM记忆,实验显示其准确率超基线,还降低token使用量、API调用和运行时间。

PaperAgent
算法论文7

GPT-6要「活」了?MIT作曝光,AI「自进化」不远了

麻省理工学院推出全自适应大模型框架「SEAL」,让模型从「被动学习者」变为「主动进化者」。网友猜测GPT - 6可能整合其能力,成为能自主学习的模型,研究虽有局限,但为大模型自进化提供路径。

新智元
产品应用8

Jina Reranker v3: 全“列式”重排器,0.6B参数刷文档检索SOTA

Jina AI推出第三代重排器Jina Reranker v3,在多语言检索基准上刷SOTA。它参数仅6亿,有“last but not late”交互机制,能一次性处理查询和文档。还提供动态量化格式,方便不同硬件部署。

Jina AI
产品应用8

Claude Sonnet 4 支持百万上下文了,AI Coding 的想象力更大了

Anthropic宣布Claude Sonnet 4支持100万Token上下文窗口,容量为之前5倍。该功能已在部分平台公测,将推给更多用户。它支持复杂任务,有定价和成本优化方案,获早期用户高度评价。

Founder Park
算法论文8

不靠海量数据,如何精准喂养大模型?上交Data Whisperer:免训练数据选择法,10%数据逼近全量效果

上海交通大学等团队提出 Data Whisperer,首个免训练的注意力驱动数据选择框架。它利用模型自身能力打分挑数据,无需训练与人工标注,用 10% 数据让微调效果逼近全量数据,在多方面领先传统方法。

机器之心
开源动态8

性能大涨!阿里开源版Qwen3模型,霸榜文本表征

今日凌晨阿里开源Qwen3-Embedding和Qwen3-Reranker两款模型,专为文本表征等任务设计,支持119种语言。测试显示其性能出色,在多语言文本表征和排序任务中超越众多模型,还采用了多种创设计与训练方法。

AIGC开放社区
7

突发|Andrej Karpathy官宣加入Anthropic!

周二晚间,Andrej Karpathy在X上自宣加入Anthropic,将在核心预训练团队工作。他是AI领域极具影响力人物,曾任职OpenAI、特斯拉等。此次加入或助推Anthropic上市,也让OpenAI面临压力,或引发一轮AI军备竞赛。

机器之心