
9月16日, 网易有道在北京举办了名为「NEXT, AGENT有道AI Open Day」的活动, 在这个现场里面, 网易有道拿出了很多最新的技术成果还有产品矩阵, 这些产品覆盖了办公、学习以及营销等多种场景, 同时呢, 它还搞了一个叫做“有道AI Agent未来市集”的地方来打造沉浸式体验空间, 好让到场的那些嘉宾能够亲身地在很近的距离去感受着人工智能是怎么进入到了真实的工作流程当中去的。这次展示的是围绕模型和Agent和工作流的组合模式, 网易有道拿出了一整套AI Agent生态的路径方案。这标志着AI正在探索一条新路, 从单纯的技术能力阶段, 走向创造用户价值的新阶段。以模型×Agent×工作流探索AI价值落地新路径网易有道的首席执行官周枫在活动现场发表观点, 他认为人工智能在过去一年的时间里发生了实质性的变化, 这种变化的核心在于智能技术已经脱离了需要由使用者亲自去搜寻和发动的传统状态而是转变成为可以无缝融入日常业务环节并代为处理难题的辅助型人才。基于这一逻辑, 接下来的工作模式应当针对AI智能体这一个新主体进行深入规划, 从而构建出既合理又快捷的全新操作路径。基于这一种趋势, 决定AI能力的核心因素, 正在从简单的、单一模型的能力, 发展为由智能体与工作流共同来组成的系统能力。在周枫看来, 模型是体现人工智能那所谓的“聪明”水平的地方, 它直接决定了整个事儿的能到什么高度的那个上限Agent这个东西是让人工智能变得“能干”起来了的, 它就是把那个本来只存在于理论里的模型能力给转化成了能够真正去动手去做的实际行动然后呢工作流就代表了那种让人觉得很“靠谱”、可以稳定交付的一种东西, 它是在保障人工智能在一个真正的、真实的业务场景之中, 所最终产出的那些价值。基于上面说的这个判断, 网易有道那边一直在接着搞那个叫作“模型矩阵乘以Agent矩阵再乘以真实场景”这样的AI体系 thing。底下那层儿用的是那个叫做“子曰”的模型矩阵, 用它来给多模态推理还有实时语音交互这些个能力提供支持。再上面一点的那一层儿就是那个叫作AI Agent产品的东西了, 把这些个模型的能力转化成了可以去执行的智能服务。最顶上那一层则是扎進到了像办公、学习、营销这些真材实料的真实场景里去头里去了, 好让AI这东西能融进到大家平时上班工作以及过日子生活里面去, 就这么回事吧你懂。拿广告营销这个场景来举个例子好了, 有道公司围绕着广告业务里所有环节的需求, 构建出了一套完整的代理和产品体系, 这套体系和它覆盖创意生成、达人筛选以及投放优化等完整链条的努力一道推动了营销效率以及效果的共同提升, 在这其中能够通过一张图像配上一句指令的方式来直接生成数字人相关的视频作品以及符合本地化需求的营销素材, 这样一来就直接导致营销素材的制作成本发生百分之八十的下跌结果, 同时广告点击率也有百分之三十的提升成果出现。平台的AI素材占比在2年里面翻了12倍, 最后达到了百分之二十五YODA是依靠了超过两千个真实的项目的数据来支持的, 它能够帮人做达人的洞察还有营销的决策小智二号是通过自动化的数据汇总还有账户管理的方法, 把跨账户查询的效率给提升了, 也把数据同步的效率给提升了。从“聪明”到“能干”Agent正在进入更多真实场景大家在现场听网易有道的多位业务负责人分享, 这些分享是围绕人工智能技术的演进过程、产品方面的创新情况以及实际的应用场景落地情况来展开的。他们系统性地介绍了有道公司在模型领域里进行的探索工作, 也介绍了在智能体方面做的探索, 还讲了在智能应用领域的探索, 最后也提到了他们在人工智能硬件这块所做的探索。网易有道的首席科学家段亦涛, 他主要分享了一些内容。这些东西集中在几个方面。一个是关于子曰模型矩阵的建设情况。第二个是关于语音模型能力的升级进展。还有第三个方面是AI技术的发展方向。在这样的分享中, 他重点推出了两个具体的成果。这两个成果就是子曰模型矩阵以及子曰Live同传模型。在今年的5月份, 有道已经把“子曰”大模型升级到了4.0版本, 并且发布了三款新模型, 这三款模型分别涉及多模态推理、跨语种零样本和翻译升级。其中前两款模型已经开源, 并且在各自所属的领域内, 与那些同样具备一定规模和技术级别的模型相比, 已经达到了非常前沿的水平。此外, 段亦涛正式宣布推出子曰Live同传模型。该团队同时开源了子曰流式ASR模型。这项技术提供了专门针对语音Agent级别的流式语音识别功能。它在确保高输出质量的前提下, 实现了极低的时间延迟和高流畅度的实时同传效果。与以往那种必须等你说完一句、我再回一句的交互模式相比。新的模型完全能够处理实时的流入和流出数据。它还全面支持双向同时进行的完整通话机制。段亦涛接着对一个人机协作的智能体, 名字叫做“有道有据”的情况做了介绍。这个平台把一些权威的数据都放到了里面。这些数据类型包括论文、专利, 还有法条之类。这样做是为了让输出的内容更忠实, 也让权威性更强一些。在这个系统里, 每一个论点都会附上可以查核的依据。不仅如此, 它还能够自动去执行写论文这样的任务, 也能自动去生成PPT这种演示文稿。段亦涛认为, 大家没必要去争论说哪些行业以及哪些职业会被替代掉, 反而是应该去思考一下在人和AI进行协作的这个情况下面, 自我价值该怎么展现出来才好, “有道有据”这个东西, 提供给用户的可不是仅仅只能用来问问题答问题的一个简单工具而已, 它更是一个可以让人和AI一起成长的一个工作台子, 让双方能够共同去完成一些任务, 最后达成了一个产出大于简单相加的效果, 也就是实现了“112”。另外一点来说的话, “有道有据”这个平台, 从某种意义上来讲它就相当于是一个大脑模型了, 同时在另一个方面来看, 它也就好比是个人类的脑细胞组织一样。在他的那种想法里面, 将来那些真正有用的AI产品, 是不可以只做一个帮人干活儿的聊天工具那么简单事的, 它是得要变成一个既能够当作工作平台用同时又像是个有生命的助手这样的一种存在状态的哦。网易有道的负责人是王宁, 他围绕办公Agent的发展趋势进行了探讨, 他还涉及到了产品进化以及AI办公生态建设方面的问题。在这次会议上正式发布了2.0版本, 新版本实现了对1.0生态的全面兼容。另外还新增了名叫Sites的功能模块和名叫Teams的功能模块, 支持将任务中产生的结果产物生成公网地址, 并且还能设置分享码来进行分享。在收费方式上采用的是按照实际使用的资源量来付费的模式, 这样一来就打破了以往采用按席位收取费用这种传统的模式。针对“Next Agent”这个概念, 王宁提出了组织、交付、信任这三个关键词。办公Agent不仅仅是一个个人用的工具, 它更应该成为把整个团队的效率变得更大的放大器。它不只是能够被做出来, 还需要方便被发出去。竞争的焦点不再是谁更加能干, 而是谁更值得被托付信任。项目团队在近日发表了国内的第一份《办公Agent用户行为报告》, 手机端的版本也马上就要上线了。他是网易有道智能应用事业部的那个负责人, 名叫张艺。他这个人是专门来分享关于声音智能领域里的一些成果的。他还分享了一些探索性的东西。他从那个叫AI交互方式的变化这里开始讲起的。他说了这么个看法, 他觉得在以后的日子里头。AI这东西需要变一下方向。以前是让那个去适应技术在先, 以后是要技术去适应人。这样子的话才能行得通。而且他认为, 将来声音这个玩意儿会成为一个非常重要的入口的。这个入口是用来把用户和AI连起来的。大家沿着这个方向去看, 网易公司在今年3月搞出了一个叫“有道AI同传”的东西, 它是行业里面第一个推出的同声翻译Agent。这个东西一直到现在, 累计服务过的用户已经超过2500万了, 而且使用的次数跟过去相比, 差不多快要翻倍了。另外还有一个叫做“网易叭哥说”的产品, 这是网易公司做的第一个AI原生的语音Agent。它依靠的是网易公司有多年积累下来的语音识别和翻译技术。它不再像传统的语音输入那样, 只是把声音转成文字那么简单, 而是直接把人们日常说的大白话, 变成结构化的文本, 这种文本质量好, 可以直接拿来就用。我们希望能够解决在生成式人工智能这个时代里面, 因为输入需求出现了爆发式的增长, 导致键盘输入的这种效率根本就赶不上人脑思考速度的这样一个行业存在的痛点。Hi Echo 这个产品和服务, 目前已经累计拥有的用户数量已经超过了1000万, 它是采用了端到端的全双工语音对话技术, 并且还搭载了完全是自己研发的目标驱动型自进化学习系统, 这个系统的名字叫做 Echo HELIX, 它主要是为了给用户带来一种低延迟的效果是可以随时打断的还支持自主规划个性化任务的像 Agent 一样的口语私教体验。来自英国文化教育协会的英语及测评业务董事总经理克里斯也来到了现场, 他把自己对于有道和雅思官方进行深度合作所产生的感受以及未来的期望都做了分享。在那个活动的现场, 有个小孩参加了与启元机器人的互动过程, 而且这个机器人是搭载了 Hi Echo 能力的, 这件事充分地展现出了关于口语 Agent 能够打破终端形式的局限并且去扩展学习边界所具备的更多的可能性。在人工智能这种技术加速向各种应用场景渗透的大背景之下, 网易有道也在不停地探索关于硬件和设备方面的融合创新活动。提到AI的价值这个问题的时候, 网易有道智能硬件事业部的负责人高慧湍曾经明确表示过, AI的根本作用绝对不是用来替代用户的需求或者想法, 而是要帮助用户去拓展自身拥有的能力, 同时也要想办法减轻大家身上的负担, 这样的话, 人们就可以把更多的心思和精力全部放在交流和创造上面去了。据介绍表明, 有道AI耳机成功地打通了从录音开始到转写、再到总结以及翻译的这样一个完整的连锁性的AI方面的能力, 它覆盖了在会议沟通这个环境下面所存在的听、记、办这三个阶段。在跨语言交流的情形下, 该产品支持使用二十余种语言来对音视频内容进行实时翻译, 同时还应用了音色克隆技术, 以此保留发言者原有的音色特征耳机舱可以独立完成录音、翻译以及外放这一些工作, 不需要依赖手机, 就可以独自承担翻译的任务。在会议记录这个环节, 它可以自动把不同的发言人都区分开, 把大家说话时重复说的或者改口的内容都整理好, 这样就能把会议录音变成文字形式的纪要还有待办事项。用户还可以就笔记里的内容进行提问, 系统在给出答案的同时, 会把来源出处也一并展示出来。值得大家注意的是, 这个产品把人工智能能力从记录环节推到了执行环节。这依靠的是有道公司在人工智能智能体领域的技术积累水平。在会议纪要里面生成的待办事项可以进一步变成能实际去做的任务清单。这就实现了从辅助记录的阶段向主动代办阶段的转变。AI Agent未来市集让技术从发布台走向真实体验活动的主会场进行了发布, 同时, 在活动外场区域, 还特意设置了“有道AI Agent未来市集”。这个未来市集打造了互动体验区, 把AI的产品能力变成了能感觉到、能亲自去体验的应用场景。现场的嘉宾能够近距离地接触到网易有道的AI Agent产品体系, 明白AI是怎么样参与到内容创作、办公协作、跨语言沟通和辅助学习提升这些实实在在的任务场景里的。从模型能力到产品创新, 从技术展示到场景体验, 网易有道希望通过此次「NEXT, AGENT有道AI Open Day」, 展示一个更加开放的AI生态。就是想让AI不只是一个被人们调用的工具, 而是让它可以去理解用户需求, 融入工作流程, 持续创造价值。最终成为一个智能伙伴。这模型的本事是在不停地变强, 然后那个能自己干活的智能体, 是真正地跑到了办公、还有学习、以及做营销这些实实在在的地方去了。因为这个事情, 所以整个AI这个行业, 是从那种拼谁能力更强的比赛, 变成现在这种去真正创造价值的一个新的阶段了。这次举行的「NEXT, AGENT有道AI Open Day」活动, 其实就是网易有道针对前面说的那个发展趋势, 做的一次集中展示: 它靠着所谓的\子曰\这个模型矩阵, 来提供基础的能力支持它还借助于那些一直在扩充的Agent产品矩阵去连接用户的需求它更是深入到了办公场景、学习场景以及营销活动还有跨语言沟通这些具体的日常工作中通过上面这些做法呢, 就让原本需要一个特定步骤才能被调用的AI工具, 慢慢地变成了一个能够听懂人们需求的智能伙伴, 还能帮着执行任务以及参与到大家的协作当中去。