「办公能力升级」共找到 3832 篇相关文章
超越Runway!Adobe发布新神器:P视频比P图还简单
Adobe联合多高校推出AI模型EditVerse,它将图片和视频编辑整合,解决传统视频编辑复杂、数据稀缺问题。通过通用视觉语言、上下文学习能力和知识迁移,其效果超Runway,还展现涌现能力。
上海AI Lab新研究:SFT能泛化,只要满足这三个条件
上海人工智能实验室等团队研究指出,“SFT泛化能力差”定论有局限。SFT泛化能力受优化过程、数据质量与结构、模型基础能力共同制约,研究还揭示其训练中的现象及副作用。
多模态推理新基准!最强Gemini 2.5 Pro仅得60分,复旦港中文上海AILab等出品
现有多模态大模型benchmark对逻辑推理理解不足,复旦大学等单位提出MME - Reasoning评估其推理能力。对30 + 模型评测,最优得分仅60%左右,反映出模型多方面推理短板。
Claude 4发布!世界最强编程模型来了
Anthropic发布Claude 4家族,含Claude Opus 4和Claude Sonnet 4,代码能力强,重新定义AI编程助手能力边界。有新功能,企业认可,Claude Code上线,记忆能力提升,立即可用且价格不变。
刚刚,Anthropic王炸Claude泄露!全面碾压Opus 4.6引爆全网
因「人为配置」错误,Anthropic最强模型Claude Mythos细节泄露。它编程、推理能力超Claude Opus 4.6,还具备网络攻防能力,但也带来安全风险,Anthropic因担心被黑客利用暂未发布。
AI编程新王Claude 4,深夜震撼登基!连续编码7小时,开发者惊掉下巴
Anthropic发布全球最强编程模型Claude 4,含Opus 4和Sonnet 4。Opus 4是顶尖编码模型,Sonnet 4是Sonnet 3.7的重大升级。还发布系列产品,Claude 4定价与此前一致,部分用户可体验。
关于中美 AI 竞争的差距,我可能真的说错了
作者因读者反馈,意识到自己对中美AI竞争差距理解不全面。基模能力中国整体落后美国,但部分领域领先。模型能力提升难被多数用户感知,且中美在商业模式、模型开源等方面差异大。
视频推理界的“福尔摩斯测试”:所有大模型,统统不及格 | 论文代码开源
腾讯ARC Lab和香港城市大学推出Video - Holmes,这是视频推理界的‘福尔摩斯测试’,能展现多模态大模型复杂视频推理能力的边界,规避现有Benchmark痛点,测试中所有大模型全部不及格,代码已开源。
AI 会笑吗?BIGAI & 上交大团队:多模态大模型是否真的能 get 到视频笑点|ACL 2026
上海交通大学等团队构建v-HUB评测基准,分析多模态大模型视频幽默理解能力。评测7个前沿模型发现,模型依赖文字、主动发现笑点能力弱,声音作用有限,还需考虑隐形线索。
当 Agent 走出 App:WorkBuddy 的朋友圈开始向外生长
9月2日深圳的WorkBuddy生态发布会,展示9款联名硬件,有30多个硬件品牌、30多个Buddy应用、100多个开放平台共创伙伴参与。WorkBuddy开放Agent能力,连接伙伴资源,解决数据和专业经验难题,开放硬件、应用与平台三层,但面临价值分配等问题。