「投资方向」共找到 1220 篇相关文章
OpenVision 2:大道至简的生成式预训练视觉编码器
多模态大模型浪潮中,视觉模块是关键。此前OpenVision训练管线复杂,成本高。研究者提出OpenVision 2,移除文本编码器与对比学习,引入随机丢弃视觉token技巧,性能佳且效率高,挑战了对比学习范式。
OpenAI新幻觉论文惹争议!GPT-5拉胯是测试基准有问题??
OpenAI新论文《语言模型为何会产生幻觉?》提出,模型有幻觉是因标准训练和评估流程倾向奖励“猜对”。GPT - 5不爱猜测,在榜单表现不佳,网友质疑论文是为GPT - 5挽尊,论文引发网友多方向讨论。
视觉Token注入CLIP语义,走向多模态理解与生成新范式
腾讯ARC Lab等机构提出全新视觉分词器TokLIP,将低级视觉Token与高级CLIP语义结合,支持端到端自回归训练,可接入LLM框架,降低计算与数据门槛,在多模态任务中表现优异,代码已开源。
AI 创业,需要重读 Paul Graham 的「创业 13 条」
2009年YC创始人Paul Graham发表《Startups in 13 Sentences》,虽时间久远但核心观点不过时。创业者Chris Saad、Yaniv Bernstein结合经验和当下环境,剖析这13条创业原则,涵盖选联合创始人、快速发布产品等内容。
刚刚,Gemini 宣布将前往太空!
刚刚,Starcloud宣布与Google Cloud合作,要把Gemini模型送上卫星运行。计划今年底或明年初通过SpaceX发射搭载NVIDIA H100 GPU的演示卫星。虽面临诸多技术难题,但在AI算力需求增长下,此举或开启新时代。
美国宣战,AI行动计划打响第一枪!「AI+材料」成最新核武器
美国白宫发布《美国AI行动计划》,将「AI+材料」推上国家级战略高度。该计划涉及投资AI赋能科学、构建数据集等五大重点领域,释放材料科学发展机遇信号,中国需全速追赶。
多模态大模型,真的「懂」世界吗?——揭秘 MLLM 的核心知识缺陷
ICML 2025高分论文揭示MLLM核心认知盲区。研究发现主流MLLM缺乏核心认知能力,且不能靠规模扩展自然习得。作者构建测评体系CoreCognition,提出干预测试方法Concept Hacking,还给出关键发现与启示。
快慢Reasoning综述!
大型语言模型在复杂推理任务中有‘无差别计算’缺陷,阻碍其在多场景应用。本文提出双层效率优化框架,梳理两类前沿技术,通过实验揭示瓶颈,为轻量化推理指明路径。
IEEE TPAMI 2025 | 北京大学提出LSTKC++,长短期知识解耦与巩固驱动的终身行人重识别
北京大学周嘉欢团队在IEEE TPAMI发布LSTKC++研究成果。该框架引入长短期知识解耦等机制,保障模型学习新知识和记忆历史知识。代码已开源,研究在性能和效率上优势明显,有广泛应用价值和拓展空间。
UofT、UBC、MIT和复旦等联合发布:扩散模型驱动的异常检测与生成全面综述
多伦多大学、麻省理工学院等高校研究者合作完成长文综述,聚焦扩散模型在异常检测与生成领域的应用,梳理图像、视频等异常检测任务进展,提供分类体系,展望未来趋势。