「预训练语言模型」共找到 8253 篇相关文章
超越谷歌Banana,字节联合香港中文大学等高校开源最强图像编辑生成系统DreamOmni2
香港多高校与字节跳动联合研发的DreamOmni2系统,实现图像编辑与生成领域SOTA。它用三步造出高质量数据,提出索引编码等方案,联合训练模型,实际效果超越部分商业模型,为AI创作带来新可能。
领先于Transformer!新架构首个1200万上下文模型SubQ,成本仅Opus的5%
Subquadratic公司提出SubQ模型,核心是SSA亚二次稀疏注意力机制。该机制改变注意力计算分配,让模型真正读长文档。SubQ是首个有1200万token上下文窗口的前沿模型,成本低、速度快,有望革新大模型扩展路径。
PITT | 提出PhyT2V框架:让文生视频(T2V)更符合物理规律(CVPR2025)
当前T2V技术迈向推理驱动阶段,物理规律是关键约束。匹兹堡大学团队提出PhyT2V框架,不依赖模型重训练或大规模外部数据,可增强主流T2V模型能力,有低落地门槛和良好泛化性。
爆冷!首届大模型争霸,Grok 4下出「神之一手」?DeepSeek、Kimi惨遭淘汰
谷歌Kaggle举办首届全球AI象棋争霸赛,八款顶级语言模型正面对抗。首战8进4淘汰战中,Gemini 2.5 Pro、o4 - mini、Grok 4、o3晋级,Claude 4 Opus、DeepSeek R1、Gemini 2.5 Flash和Kimi K2出局。比赛考验AI整体理解能力。
狂揽22.6k星!这个开源工具让你一键调用100+大模型,开发效率直接起飞!
LiteLLM是BerriAI团队开发的开源工具,通过标准化OpenAI格式API接口,能无缝调用100+主流大语言模型。有核心功能亮点,适用于多场景,还给出上手步骤,并与同类项目对比。
Alex Wang“没资格接替我”!Yann LeCun揭露Meta AI“内斗”真相,直言AGI是“彻头彻尾的胡扯”
图灵奖得主 Yann LeCun 在访谈中,尖锐评价当前 AI 发展路径,认为规模化大模型是死胡同。他正通过新公司 AMI 推动“世界模型”技术路线,还谈到 AI 关键要素、安全等问题,与主流观点分歧明显。
下一代目标检测模型:3B参数MLLM Rex-Omni首度超越Grounding DINO,统一10+视觉任务
IDEA研究院团队用3B参数的Rex - Omni打破MLLM目标定位精度僵局。它统一视觉任务,结合坐标编码与强化学习,在多项检测基准超Grounding DINO等,解决定位和行为缺陷,为MLLM成下一代检测模型提供方案。
AI领域并无真正的新想法,只有新的数据集
作者Jack Morris认为AI虽进步明显,但范式转变级突破不多。大语言模型四次关键突破底层理论早已有之,新在于数据。改变数据比调整模型或算法作用更明显,推动AI进步应找新数据,如YouTube或具身化数据。
图像界的DeepSeek!12B参数对标GPT-4o,5秒出图,消费级硬件就能玩转编辑生成
Black Forest Labs开源旗舰图像模型FLUX.1 Kontext[dev],专为图像编辑打造,能在消费级芯片运行。12B参数少、推理快,性能媲美闭源模型。有诸多特点,经优化训练,在KontextBench基准表现优。
谷歌的DeepSeek时刻:LLM推理加速被干到了8倍
谷歌TurboQuant论文介绍量化算法,能为大语言模型和向量搜索引擎大规模压缩。可将大语言模型KV缓存内存减至少6倍、加速达8倍且精度零损失,还介绍其工作原理及实验结果。