「功能测试」共找到 3143 篇相关文章
美团开源新模型,多项能力实测第一
美团发布5600亿参数的LongCat - Flash模型,有创新动态计算机制和高效训练推理架构。它在多项测评中领先,尤其在代理工具使用测试表现出色,还以宽松许可开源,降低使用门槛。
马斯克首个编码模型上线,编程飙进Top5!这9位华人天团爆肝打造
xAI上线首个编码模型Grok Code Fast 1,速度快且性价比高,在编程基准测试中冲进前五。它全栈开发能力出色,背后核心团队华人学者占多半,xAI还给出提示词编写指南。
Karpathy氛围编程最新指南!三层AI编程结构:顺境Cursor,逆境Claude,绝境GPT-5 Pro
大神Karpathy发布全新Vibe Coding指南,总结出AI编程三层结构:Cursor负责自动补全与小修改,Claude Code/Codex实现大功能块,GPT - 5 Pro解决难题。该指南是对Vibe Coding概念的升级。
AI时代,企业微信5.0的实用主义答卷 | 甲子光年
在AI浪潮下,企业微信5.0于8月20日发布,未推‘无所不能’的AI Agent,而是将AI融入搜索、总结、问答、表格等高频办公场景,解决数据孤岛,赋能内外协作,以实用主义破企业级AI落地难题。
狂肝一周,测评十余款 PPT AI 生成产品的真实反馈
评估 Agent 产品能力复杂,以 PPT 生成为例,有 Agent 和模板化两种流派。作者选前者投票测评、后者全方位测试。给出方案,还推荐不同需求适用产品,附总榜单和细致体验描述。
思维链可无限延伸了,MIT等打破大模型上下文天花板
MIT等机构提出新架构Thread Inference Model(TIM),配合专用推理引擎TIMRUN,把推理过程变为树状递归子任务结构并修剪子任务,让模型突破输出窗口限制实现长程推理,实验验证了其性能。
谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草
大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。
Gemini CLI 新升级:深度集成 VS Code,终于不用在终端和编辑器之间反复横跳了
Google发布Gemini CLI重要更新,实现与VS Code深度集成,从架构层面解决AI编程助手的上下文感知问题。新版本有工作区上下文感知和原生差异对比界面两个核心功能,还给出部署要求。
华人团队终结Token危机:扩散模型数据潜力超自回归三倍
最新研究发现,token数量受限下,扩散语言模型数据潜力超自回归模型三倍多。一个1B参数的扩散模型用1B tokens训练,在基准测试取得不错准确率,且未现性能饱和。
NotebookLM能生成PPT了,还带演讲配音
谷歌NotebookLM有新功能,输入数据、图表、旁白就能自动生成带AI音频的PPT,还能让AI写旁白。此功能对总结汇报、学习新知识都实用,也有人试用后反馈存在速度慢等问题。