「模型架构」共找到 8678 篇相关文章

产品应用8

全球首个从语言出发构建的智能体:MoonBit Pilot 如何推动自动化软件交付?

MoonBit Pilot是从语言底层构建的代码智能体系统,将AI Agent从“助手”推向“合作者”。它比Cursor、Codex更快更稳定,能云端异步执行,有Sub Agent架构和分段编译机制,或成未来软件工业新标准。

AI科技评论
算法论文8

多模态后训练反常识:长思维链SFT和RL的协同困境

华为与香港科大研究发现,多模态视觉语言模型中,长思维链SFT与RL组合难协同增益。研究引入难度分类方法构建数据集,分析各方法表现及组合策略困境,还给出实验发现与未来研究方向。

机器之心
新闻资讯8

从OpenAI离职创业到估值1700亿美元,Anthropic用4年时间引硅谷巨头疯狂押注

最新消息,Claude背后公司Anthropic即将达成新一轮融资50亿美元,总估值达1700亿,不到半年估值涨近3倍。该公司由前OpenAI员工创立,获亚马逊、谷歌等投资,其模型在代码生成领域优势明显。

量子位
新闻资讯7

Altman 嘲讽 Meta 挖走的不是顶尖人才,OpenAI 高管首曝内幕:ChatGPT 如何让我们一夜“封神”

AI 领域人才抢夺激烈,Meta 招募 AI 人才触动 OpenAI。OpenAI CEO Altman 嘲讽 Meta 没挖到顶尖人才,还透露正评估薪酬。同时,OpenAI 播客揭秘 ChatGPT 幕后,包括名称由来、传播、内部辩论等,也谈到模型问题及应对。

InfoQ
新闻资讯7

英伟达中国一把手造国产GPU,冲刺IPO了

摩尔线程完成上市辅导,冲刺IPO。其创始团队来自英伟达,创始人张建中深耕GPU近二十年。公司产品丰富,涵盖全功能GPU、大模型训推产品、专业和游戏显卡等。同时介绍了燧原和壁仞的上市情况。

量子位
产品应用7

Spring AI 实战|Spring AI入门之DeepSeek调用

文章介绍Spring AI框架,它简化企业数据或API服务与大模型集成,降低开发复杂度。还给出调用DeepSeek的实战步骤,包括手动请求、代码自动发起、实现流式响应等,也提及OpenAI starter的兼容性及生产环境监控。

阿里云开发者
新闻资讯7

曦望,死磕AI推理成本|甲子光年

1月27日,国产GPU厂商曦望发布新一代推理GPU芯片启望S3等。启望S3面向大模型推理定制,设计系统级重构,单位Token推理成本降约90%。曦望还推出超节点方案及推理云计划,目标是极致推理性价比。

甲子光年
产品应用8

中国团队一夜封神,AI出海「全球第一」!曾靠游戏狂赚10亿美金

在大模型竞争激烈的当下,中国出海团队SeaArt(海艺)用2.5年超越Midjourney等,成全球访问量第一的AI内容创作社区。它打造AI原生内容生态,SeaVerse开启全模态时代,还靠洞察用户、游戏基因等优势制胜。

新智元
产品应用8

告别碎片化日志:一套方案采集所有主流 AI 编程工具

在AI编程工具普及的当下,有效采集和分析AI代码生成数据成重要课题。该文介绍一套基于MCP架构的多AI工具代码采集方案,支持多种工具和操作系统,有轻量化、用户无感等特点,已和Aone合作。

阿里云开发者
算法论文8

语义分割别无脑用Argmax!港中文新算法:三行代码,推理速度提升10倍

香港中文大学提出全新算法框架RankSEG提升语义分割性能。传统方法用threshold或argmax生成掩码并非最优,RankSEG无需重训模型,加三行代码就能提高分割指标,还开源了工具包,其改进版RankSEG - RMA推理速度大幅提升。

新智元