大模型幻觉」共找到 9197 篇相关文章

产品应用7

The Batch: 954 | Kimi K2.6 挑战开源权重模型领先者

Moonshot AI升级后的Kimi K2.6是1万亿参数的视觉 - 语言模型,专为代码生成设计,性能与Qwen3.6 Max Preview等相当,略逊顶级闭源模型。其功能多,幻觉率低,模型权重可免费下载。

DeeplearningAI
算法论文8

字节Seed新作:模型合并如何改变模型预训练范式

字节跳动Seed团队在arXiv发表论文,提出预训练模型平均(PMA)技术。该技术将模型合并引入预训练阶段,可提升性能、预测衰减阶段表现,还能解决训练问题。不过,高学习率影响和强化学习应用待研究。

机器之心
算法论文8

GUI 精准定位新 SoTA:LASER 让模型从“看全图”走向“锁重点”

多模态模型在高分辨率、元素密集的 GUI 场景易误判。苏州学 OpenNLG 团队提出 LASER 方法,让模型学会主动推理,通过关键区域聚焦等提升定位精度,在基准测试中表现出色。

深度学习自然语言处理
算法论文8

蚂蚁 | 提出代码检索/重排基准:CoREB,揭开高分榜背后的三幻觉,现已接入MTEB

蚂蚁研究人员提出代码检索与重排评测基准CoREB,解决现有基准相关性软、数据污染、任务方向单一问题。它已集成进MTEB,收录19个模型×6个任务评测结果,为代码检索模型评估提供新基线。

AINLPer
新闻资讯7

神秘模型屠榜多日、碾压Seedance 2.0!背后竟是阿里招:新部门首作实锤,引爆股价拉升

近日,神秘模型 HappyHorse-1.0 登顶 Artificial Analysis 视频模型排行榜。4 月 10 日,阿里确认它是 ATH - AI 创新事业部自研产品,正在内测。该模型技术亮点多,若开源或使 AI 视频行业格局生变。

AI前线
开源动态8

1M 参数干翻 200M!时序预测选模型,你可能一直都选错了

近期时序预测领域新模型频出,作者开源的 QuitoBench 显示,参数量仅 1M 的 CrossFormer 击败模型夺冠。它还揭示模型选择与历史数据长度有关,且数据边际收益高于参数。

AINLPer
开源动态8

多模态长文本理解测评首发:46款模型无一攻克128K难关

香港科等研究者联合提出MMLongBench,用于评估多模态模型长文本理解能力。它覆盖5类型任务的16个数据集,对46个模型测试显示,闭源和开源模型在长上下文任务均面临挑战,OCR和跨模态检索能力是瓶颈。

量子位
算法论文8

NeurIPS2025 Spotlight | RobustMerge: 多模态模型高效微调模型合并的全新范式

中科院、中山学、北团队针对高效微调模型合并难题,提出「方向鲁棒性」概念,揭示 PEFT 模块合并失败主因,给出 RobustMerge 解决方案,提升性能,成果开源。

机器之心
开源动态8

被 AI 厂逼至绝望,这帮欧洲人发起了一场“科学复兴运动”

AI前沿成果被科技巨头锁在“黑箱”,欧洲科学家、工程师等发起“科学复兴运动”成立LAION。他们构建开放数据集,训练出表现优异的模型,还进行“爱丽丝梦游仙境”研究测试模型,探讨推理模型发展方向。

AI科技大本营
新闻资讯7

基金或将领投DeepSeek?算力拐点将至

5月6日报道国家基金正洽谈领投DeepSeek首轮融资,估值约450亿美元。基金此前未公开投资模型公司,此次若落地是从“半导体硬件”向“AI应用端”延伸。2025年是中国AI芯片出货量关键年份,DeepSeek-V4发布,多家国产芯片品牌完成适配,但国产芯片仍面临性能、软件生态等挑战。

芯师爷