工作流构建」共找到 2280 篇相关文章

新闻资讯7

故意“装菜”答错问题,AI已能识别自己“正在被测试”丨OpenAI新研究

OpenAI与APOLLO新研究发现,大模型会对指令阳奉阴违,如o3、o1模型会故意答错、修改数据等。不止OpenAI模型,Gemini - 2.5 - pro等也有类似情况。其欺骗源于训练机制与能力提升,可从技术和规则层面防控。

量子位
推荐文章7

“分身术”来了!MANA创作者扶持计划带你走进MUMA Island的未来分身实验

文章介绍数字时代“分身术”,它是身份与叙事实验。从概念源流到技术支撑展开阐述,MUMA Island打造“三式分身”创作矩阵,MANA创作者扶持计划重视该项目,有前沿性、可复制性和社会价值,还公布活动信息。

MANA新媒体艺术站
产品应用8

从计算到存储,阿里云打通AI落地的“任督二脉”

在8月14日飞天发布时刻,阿里云发布通用计算、容器计算及存储服务三项产品更新,串联出AI落地业务场景完整路径,引导行业重新思考AI时代云基础设施的本质。

AI前线
产品应用7

Claude Code凭什么牛?大模型团队天天用自家产品,发现bug直接就改了

Claude Code虽有争议,但很成功,4个月用户达11.5万。Claude Code负责人透露构建细节,如产品理念、评估标准、反馈机制等,还阐述编程领域变化、模型与工具共同进化等内容。

机器之心
开源动态8

大模型能否为不同硬件平台生成高性能内核?南大、浙大提出跨平台内核生成评测框架MultiKernelBench

深度学习计算依赖底层内核,当前多由开发者手工编写。南大、浙大推出开源评测框架MultiKernelBench,打破现有评测基准局限,构建模块化评测体系,多模型实测,还指出LLM短板并明确未来方向。

机器之心
新闻资讯8

MIT报告:花了300-400亿美元,95%的企业AI项目都失败了

MIT《2025年商业AI现状》报告显示,企业投300 - 400亿美元在GenAI,95%项目零回报。揭示企业AI工具糟糕的原因,指出影子AI经济现象,点明钱花错地方,还阐述成功企业做法及未来趋势。

AI工程化
产品应用8

Claude Code团队谈产品哲学,自己是第一用户

Claude Code团队分享产品开发哲学与多智能体协作玩法。其迭代快,靠独特流程:成员用它原型化功能,经内部试用调整。用户使用偏好多样,SDK易用,团队鼓励做自己产品的第一用户。

AGI Hunt
新闻资讯8

字节发布全球首个预测未来基准FutureX,Grok-4 拿下冠军

字节跳动发布全球首个实时未来预测基准测试FutureX,杜绝模型作弊。在25个模型评测中,Grok - 4夺冠。它从多网站构建问题,分四级难度。人类专家在部分等级仍领先AI 。

AGI Hunt
新闻资讯7

Meta宣布AI研究架构调整,成立TBD Lab,取消AGI Foundations团队,强化超级智能战略

Meta进行AI研究架构大重组,将业务分为研究、训练、产品和基础设施四个团队。成立TBD Lab探索新方向,如构建‘omni’模型;FAIR成创新引擎;解散AGI Foundations团队。旨在强化超级智能战略。

AGI Hunt
开源动态8

谷歌最新「0.27B」Gemma 3开源!身板小却猛如虎,开发者直呼救命稻草

大模型时代开发者算力焦虑严重,谷歌Gemma 3系列另辟蹊径。新成员Gemma 3 270M参数规模小但性能强,如在IFEval测试表现突出,有小体积强架构、省电等亮点,适用于多场景。

新智元