文心大模型4.5」共找到 8914 篇相关文章

开源动态8

腾讯Hy3正式版亮相,幻觉率更低,Agent能力更强

7月6日腾讯Hy3正式版上线并开源,总参数量295B。它幻觉率从12.5%降至5.4%,Agent能力大幅提升,在生产力场景表现出色,基准测试结果良好,价格有优势,腾讯内部9条线已接入。

AIGC开放社区
新闻资讯8

刚刚,阿里CEO吴泳铭发布「ASI宣言」:超级智能才是终局!

阿里巴巴CEO吴泳铭发布「ASI宣言」,认为AGI仅是序章,ASI才是终局。阿里云有两大战略路径,通义千问家族模型性能提升,如Qwen3 - Max超越GPT - 5,各模型在不同领域有出色表现。

新智元
新闻资讯7

拒掉字节、谷歌橄榄枝,Meta 离职大佬田渊栋官宣自立门户!苏妈老黄追着投

Meta离职大佬田渊栋官宣创业,新公司Recursive Superintelligence首轮融资6.5亿美元,估值46.5亿美元。其团队豪华,想跳出大模型竞争老路,让AI具备自我进化能力,计划2026年中期推出自主训练系统。

InfoQ
算法论文8

LLM的下一战:从狂卷数据到精算数据

模型竞争核心正从比拼数据规模转向数据使用效率和风险管理。文章分享2025两篇论文,介绍高效训练和机器遗忘两赛道,前者有数据价值飞轮5大模块,后者提出三时段分类法、三层次遗忘及评价指标全景。

PaperAgent
新闻资讯7

2025年了,AI还看不懂时钟!90%人都能答对,顶尖AI全军覆没

AI基准ClockBench测试AI读模拟时钟能力,人类平均准确率89.1%,11个主流大模型最好仅13.3%。研究展示了LLM局限性,分析了可能原因,还对比了不同模型表现及在各类问题上的差异。

新智元
算法论文8

33%!Claude、GPT、Gemini 在真实网站上集体翻车,ClawBench 把 AI agent 打回原形

ClawBench让AI在144个真实网站执行153个日常任务,结果惨烈,如Claude Sonnet 4.6每三任务翻车两个,GPT - 5.4仅完成10个。它还揭示AI在真实环境的问题,为评估模型提供标尺。

机器之心
开源动态8

Qwen3.8-Flash-Next:SGLang Day-0 支持

2026年8月26日,Qwen团队开源多模态MoE模型Qwen3.8-Flash-Next,是Qwen4架构早期预览版。SGLang在发布首日提供完整支持,模型架构多方面升级,亮点众多,还介绍各组件优化及PLE架构与卸载优势。

GiantPandaLLM
新闻资讯8

OpenAI 3万亿美元测试,AI首战44个行业人类专家!

OpenAI推出GDPval评估体系,通过真实工作任务审视大模型潜力,揭示AI从实验室走向3万亿经济战场的可能。早期测试显示,Claude Opus 4.1表现最佳,GPT系列进步快,模型在部分任务逼近人类专家水平。

新智元
开源动态8

刚刚,国产AI自己造了AI,全球首例!

面壁智能实现全球首例国产AI造AI,用AI编写预训练框架ForgeTrain,性能超英伟达Megatron,还训练出MiniCPM5 - 1B模型。该模型可作桌宠,小尺寸高智能,还能自定义人格,提供工具链。

量子位
新闻资讯7

两个小时,10美元,Karpathy做了一个《指环王》3D游戏

Andrej Karpathy 让 Opus 5 根据《指环王》开篇文字,用 Three.js 制作三维场景,成本约 10 美元,两小时写出 5500 行代码。虽效果粗糙但有趣,他设想未来大模型能按需生成虚拟世界,不过也暴露大模型难以检查成果的问题。

机器之心