长文本优化」共找到 2123 篇相关文章

开源动态8

谷歌开源Gemma 3n:2G内存就能跑,100亿参数内最强多模态模型

本周五凌晨,谷歌正式发布、开源全新端侧多模态大模型 Gemma 3n。它有多模态设计、专为设备端优化等特性,核心是 MatFormer 架构,还采用了 PLE 技术等,在多方面实现质量提升。

机器之心
新闻资讯7

泪目!靠AI让爷爷「复活」,他拿下红杉1600万刀?要让所有地球人数字永生

国外14人团队Delphi获红杉领投1600万美元A轮融资。其产品源于创始人想复活中风祖父,现成为“数字思维图书馆”。2023年12月测试版上线,有人靠它年入百万,未来想服务大众。

新智元
新闻资讯8

ChatGPT上瘾,大脑萎缩47%!MIT祭出206页92图超报告

麻省理工学院完成针对ChatGPT用户的首次大脑扫描研究,发现期依赖大模型,学习能力下降、大脑受损,神经连接减少47%。AI提高效率或为误解,使用它是用期思维能力换短暂效率。

新智元
开源动态7

这个开源模型的UI审美碉堡了~

当下流行基于大模型生成HTML源码可视化文本内容,网页审美对模型很难。早期用Claude 3.7,后有DeepSeek V3 0324等。Tesslate开源基于Qwen微调的模型,尺寸全,审美佳,想象空间大。

探索AGI
算法论文8

扩散语言模型真的会比自回归好?理论分析结果可能恰恰相反

北京大学和蚂蚁集团研究表明,扩散语言模型虽理论上有并行生成优势,但实践中在某些任务推理成本更高。研究通过实验对比,分析了扩散与自回归模型在不同评估指标下的效率,指出选择模型要视任务需求。

机器之心
推荐文章7

技术更新 or 组织重塑,企业如何用好“数据智能”?

InfoQ《极客有约》X AICon 直播栏目邀专家探讨企业数据智能应用。谈及构建数据集、优化检索效率等问题,还分析数据准备挑战、DeepResearch 优势,指出数据智能落地面临组织与技术层面的挑战。

InfoQ
算法论文8

10个小模型并联跑赢GPT-4.1!无额外训练,方法仅4步

上海人工智能实验室等机构提出Avengers框架,无需额外训练,通过四步集结小模型优势。实验表明,其在15个数据集上平均得分超GPT - 4.1,还探究了框架有效的要素,对AI研究和开源社区意义重大。

量子位
算法论文8

模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞

上海人工智能实验室与香港中文大学研究团队发布论文,用MathIF基准揭示大模型“聪明”和“听话”有矛盾,越擅推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。

深度学习自然语言处理
推荐文章8

她如何把“系统2”带给了大模型 |对话微软亚洲研究院张丽

本文是量子位对微软亚洲研究院首席研究员张丽的访谈。张丽团队在2023年开始探索大模型深度推理能力,2025年1月发布rStar - Math,用蒙特卡洛搜索算法让7B模型实现o1级数学推理能力,引发广泛讨论。

量子位
产品应用8

Agent大革命!Claude 4连续自动编程7小时,刷新世界记录

今天凌晨Anthropic召开开发者大会,发布Claude 4,含Opus 4和Sonnet 4。Opus 4编程智能体连续工作7小时破纪录,Sonnet 4在SWE - bench表现超前沿模型。还新增功能,Claude Code开放,API也有新特性,Sonnet 4免费但有限制。

AIGC开放社区