产品测试」共找到 3226 篇相关文章

新闻资讯7

Claude最强领域被GPT反超!GPT 5.5最难编程基准破0

编程领域曾由Claude引领,如今GPT 5.5在大模型解决率为0%的最难编程基准上实现突破。程序重建基准测试(ProgramBench)考验严苛,过往模型解决率为0,GPT 5.5高和超高推理模式成功破局,展现了不同解题风格。

AIGC开放社区
产品应用7

回归C++: 在GGUF上构建高效的向量模型

Jina AI分享将纯解码器向量模型适配到GGUF格式及在llama.cpp工具链的优化经验。经处理得到特定任务v4模型,还生成量化版本并上传。介绍使用方法、注意事项,经测试推荐IQ3_S或IQ3_M版配合定制工具。

Jina AI
产品应用8

文心X1.1三大能力狂飙,海内外实测还挺惊艳!

9日WAVE SUMMIT深度学习开发者2025大会上,文心大模型X1.1发布,事实性、指令遵循、智能体能力显著提升,多项测试表现佳。它能做到知识一致,精准遵循指令,智能体解决问题出色,代码、数学、多模态能力也有进化,得益于迭代式混合强化学习训练框架。

新智元
产品应用8

Claude Code 5亿美元背后的AI工程革命

文章介绍了Claude Code的诞生故事、技术选型、开发流程等。它从听歌小工具变为年入5亿美元产品,90%代码自写,开发流程快,还重新设计终端交互。Anthropic团队各环节AI化,也有特殊条件,有些经验可借鉴。

宝玉AI
新闻资讯7

英伟达挑战者,估值490亿

AI芯片初创公司Groq完成7.5亿美元融资,估值达69亿美元。它由前谷歌工程师创立,致力于打破英伟达垄断,产品能低成本维持AI性能,但在生态、大规模模型支持等方面与英伟达有差距,短期内难威胁其地位。

芯师爷
开源动态7

MiniMax深夜开源首个推理模型M1,这次是真的卷到DeepSeek了。

MiniMax深夜开源首个推理模型M1,其上下文能力媲美Gemini 2.5 Pro。M1在部分评测中表现中规中矩,但在MRCR(4 - needle)测试中屠榜。它得益于MiniMax - 01基座模型,应用Lightning Attention机制,开源了40K和80K两个版本。

数字生命卡兹克
新闻资讯7

发布智驾商用方案,千里科技的转身与雄心|甲子光年

今年6月23日,千里科技发布面向L2+级的千里智驾1.0,公布L3、L4级产品路线图。其前身是力帆科技,转型后与吉利合作。该方案分三版本,还将推L3、L4级别方案。公司有“一横一纵”能力,站位供应商。

甲子光年
新闻资讯8

1700亿美元估值!Anthropic融资50亿,AI独角兽争霸战进入新阶段

Anthropic拟融资30 - 50亿美元,估值达1700亿美元,或成全球估值最高未上市AI公司之一。它由前OpenAI成员创立,聚焦AI安全。核心产品Claude有独特优势,与GPT - 5各有千秋。其商业化侧重企业,虽增长快但亏损大,业内对估值看法不一。

AIGC开放社区
开源动态8

又是王冠:27M小模型超越o3-mini!拒绝马斯克的00后果然不同

27M小模型HRM由拒绝马斯克的00后王冠开发,超越o3 - mini - high和DeepSeek - R1,推理不靠思维链。它采用分层推理等五项核心技术,在多测试中表现出色,虽被指通用性不足,但有人看好其仿脑架构。

量子位
新闻资讯7

Sora 2 惊现 LLM 推理能力,视频生成模型也能搞推理?

Sora 2在科学推理基准测试中获55%成绩,虽不敌GPT - 5,但一个视频生成模型能做推理令人惊讶。Epoch AI实验发现其可能借LLM重写提示词答题,网友也证实背后或有GPT - 4o等处理。此外,Google研究显示视频模型经大量训练或有推理能力。

AGI Hunt