大模型开发」共找到 10003 篇相关文章

推荐文章7

Transformer | 一文带你了解Embedding(从传统嵌入方法到模型Embedding)

文章介绍Embedding基础知识,从传统统计方法到如今模型用例演变过程。涵盖传统、静态、上下文及模型Embedding技术,如TF - IDF、word2vec、BERT等,还剖析DS - Qwen1.5B的Embedding并以图展示。

AINLPer
算法论文8

模型越聪明越“不听话”?MathIF基准揭示AI服从性漏洞

上海人工智能实验室与香港中文学研究团队发布论文,用MathIF基准揭示模型“聪明”和“听话”有矛盾,越擅长推理越易忽略指令,还分析了原因并给出让模型更“听话”的方法。

深度学习自然语言处理
新闻资讯7

谷歌技术报告披露模型能耗:响应一次相当于微波炉叮一秒

模型耗电舆论高,谷歌用数据还击。谷歌首席科学家称Gemini能耗低于预期,一年间能耗降至1/33,碳排放降至1/44。谷歌用更全面指标计算能耗,还从多方面优化使Gemini能耗降低。

量子位
产品应用7

变天了!WindSurf推出workflow功能,低代码模型应用开发平台将面对“降维”打击

Windsurf在1.8.2版本推出workflow功能,其采用自然语言定义工作流并与开发IDE深度集成,是更高级形态。该功能特性丰富、应用场景多,对Dify等应用编排工具或造成‘降维打击’。

AI工程化
算法论文8

联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型

香港学联合字节跳动提出视频 - 音频联合生成框架 JoVA,支持音视频 Token 跨模态交互,引入嘴部区域特定损失解决口型同步问题。实验显示,它用约 190 万条数据就达先进水平。

机器之心
推荐文章7

模型协同架构在金融智能投顾中的应用与挑战

本文整理自北银金科高级算法专家尹辰轩分享,介绍模型协同架构下的模型投顾方案,能解决幻觉问题、优化回答深度。还提到 12 月 19 - 20 日 AICon 北京站聚焦多热门方向。

InfoQ
算法论文8

首篇WebAgents综述:模型赋能AI Agent,实现下一代Web自动化

互联网任务重复繁琐,香港理工学研究人员从架构、训练和可信性等角度,总结WebAgents代表性方法,梳理研究进展。WebAgents能根据用户指令完成网页任务,其发展预示人机关系新纪元。

新智元
新闻资讯7

刚被马斯克收购,Cursor掏出新模型:10万卡加持,和Opus、GPT一样

本周二,刚被SpaceX收购的Cursor在首届旗舰会宣布新的1.5万亿+参数模型,在超10万块GPU预训练。Cursor CEO称其规模与Opus、GPT相当,还谈了对其他AI实验室看法,新模型将几周内发布。

机器之心
开源动态8

英伟达巧用8B模型秒掉GPT-5,开源了

英伟达携手港开源Orchestrator-8B小模型,在HLE测试中分数超GPT - 5,成本低且速度快。它靠ToolOrchestra训练法,协调工具解题。此赛道已有多项研究,小模型实用优势明显。

量子位
算法论文8

一个模型千万个灵魂!Anthropic找到了防止AI陷入疯狂的防线

Anthropic和牛津学研究发现,模型的AI助理角色易在长对话中漂移崩塌,致其陷入幻觉。研究解析助理轴,揭示模型人格定位,还提出激活上限技术,能在保能力的同时降低有害回复率。

AIGC开放社区