文心大模型4.5」共找到 8850 篇相关文章

算法论文8

谢赛宁团队新基准让LLM集体自闭,DeepSeek R1、Gemini 2.5 Pro都是零分

纽约大学等8家机构研究者提出LiveCodeBench Pro竞技编程基准测试,评估了Gemini 2.5 Pro等前沿大模型。发现当前模型有显著不足,在无外部工具时,高难度题通过率为0,LLM与人类大师级水平差距明显。

机器之心
新闻资讯8

一个大脑搞定所有模态,百度ERNIE 5.0技术报告公布

模型发布近3个月后,百度ERNIE 5.0技术报告公布。其底座用超级稀疏架构,参数量万亿但推理激活参数不到3%,实现四种模态原生自回归统一,还在路由调度、训练范式等多方面有创新。

量子位
开源动态8

有人把 Opus 4.6 换掉了,成本省了 97%

智谱开源 GLM - 5.1,数小时获两百万 + 阅读,海外反应更热烈。它在多个编码基准测试成绩优异,如 SWE - Bench Pro 全球第一。还能完成长程任务,有开发者已用其替换 Opus 4.6 节省成本,但速度问题待解决。

AGI Hunt
开源动态8

LeCun预言成真!790年长视频,炼出最强开源「世界模型

2025年‘世界模型’成AI巨头战场,谷歌、李飞飞团队等纷纷布局。上周北京智源研究院发布Emu3.5,340亿参数,基于790年长视频数据训练,其架构优越,推理快,能力强,还公开技术报告邀全球探索。

新智元
新闻资讯7

刚刚,Anthropic王炸Claude泄露!全面碾压Opus 4.6引爆全网

因「人为配置」错误,Anthropic最强模型Claude Mythos细节泄露。它编程、推理能力超Claude Opus 4.6,还具备网络攻防能力,但也带来安全风险,Anthropic因担心被黑客利用暂未发布。

新智元
产品应用7

不吹不黑,GPT-5代码能力究竟怎么样?跟 Gemini 和 Claude 的对比测试给你答案

作者测试了 GPT-5 的代码能力,并与 Gemini 和 Claude 对比。在不同代码任务中,各模型表现不同。如在生成网页任务里,GPT-5 部分结果不错,但受 32K 上下文限制,长文本处理不如 Gemini,硬实力也不如 Claude。

歸藏的AI工具箱
新闻资讯8

20万人抢的全球大模型第一股,我中签了

智谱在港交所上市成全球大模型第一股,作者申购中签。智谱专注AI Coding,迭代快,GLM - 4.7成绩亮眼,商业化数据佳,还有诸多有意思细节,虽行业竞争大,但它表现不错。

花叔
新闻资讯8

创新常常发生在无人走过的路上|5Y News Monthly

「5Y News Monthly」回顾五源及被投企业新闻动态。被投企业有投融资、合作、新品发布等大事,如极壳完成7000万美元融资,月之暗面发布Kimi K2 Thinking模型。五源也有荣誉、观点分享等动态。

五源资本 5Y Capital
新闻资讯8

OpenAI连破10道数学难题,Fable 24小时「复现」5道

这个周末,OpenAI与Anthropic两大AI巨头在数学前沿短兵相接。先是OpenAI用未发布模型Astra证明10项数学成果,不到24小时,Anthropic的Fable复现了其中5项。AI解难题成本降低,成果验证成新考验。

新智元
产品应用7

Seedance 2.5 专业创作实测:3D导演台、局部重改、角色库如何释放模型能力

Seedance 2.5升级,3D导演台自带图片生成白模功能、打通3D工作流;有片段重拍实用功能;小云雀升级角色资产能力。除素材增加,其更理解原视频创意逻辑,还有多模态参考等功能,降低创作门槛。

AI进修生