时间:2025-07-29 01:06 作者:灵小道
阿里国际副总裁张凯夫:人类跟AI交流,告诉它不要做什么特别重要,阿里创始人张近东
“虽然OpenAI的Deep Research能力很强,但其适合做广泛的搜索和很长的报告。对于出口商品HS Code这样一个具体要求精确答案的任务,正确率却只有5%。我们在垂直数据库上,做了工具的减法,以及上下文工程。这个垂直Deep Research范式的HS Code判定工具,准确率可以做到80%。”
为了服务更多出海贸易商家,阿里国际AI Business开始做中国商家自己的“Deep Research”和垂直AI Agent。
人类跟AI交流,告诉它不要做什么特别重要
“通用”和“垂直”的路线之争,一直是人工智能领域的母命题。
2023年,国内业界、学界围绕“做基础大模型,还是做垂直/行业大模型”进行了不少讨论。有的从业者认为,要抓紧基础大模型的研究,在底座模型上奋力追赶,尤其是要摆脱对国外开源模型的依赖;也有从业者认为,中国市场巨大、数据丰富,应用场景多元,可以用应用发展来带动模型进步,走一条“农村包围城市”的路线。
从DeepSeek搅动全球风云,到各行各业的专业大模型集体涌现,事实上,中国在这两条路上走得其实都不错。
此时此刻,恰如彼时彼刻。
谈到行业观察,阿里国际副总裁、阿里国际AI Business负责人张凯夫对观察者网等媒体表示,AI应用领域已经随着行业从AIGC(生成式人工智能)走向了Agent(智能体):以前的应用很多是AIGC,比如生成图、搞翻译、弄创意;今年更多是智能体,比如硅谷很火的BD agent,去找中小企业的联系方式;合规Agent,从厚厚的法律材料中寻找合规相关内容;比如营销Agent,根据客户需要去各种社交媒体发帖等等——这些过程都是自动的。
“最近硅谷很火的概念是context engineering(语境工程,或上下文工程),我们用一个模型,语境(context)非常重要。现在我们做智能体也是一样,语境的约束特别重要,有时候你喂给它(Agent)的东西越多越不好,你一定要非常有针对性地喂给它一些内容。”
张凯夫进一步表示,现在人类和AI交流,给它定好约束条件,告诉它不要干什么特别重要——包括AI coding(用AI写代码)。“想让AI干嘛,大家都可以表达,但真正地核心在于让AI明确,解决这个问题的时候不是要新建代码文件,而是找到对应的具体代码去修改。如果没有这个约束条件,代码库就会越来越大,到后面一塌糊涂。”
“我们做一个Agent也是一样的,语境缩减和精准选择是非常重要的一件事情。”
阿里国际AI Business算法负责人骆卫华补充道,Deep Research等通用性Agent,在解决很多通用性问答时是没问题的。甚至通过底座模型能力,可以通过prompt(关键提示词)调优来获得更好的结果。但是真正落地到非常专业、垂直的领域,通用型Agent是不够用的,比如在海关编码HScode上,它就是只有个位数的正确率。
日均10亿次调用,中国跨境电商成为第一个实现规模级AI应用的行业
相比于通用模型谈概念、讲参数,更贴近中国普通人经营实际的是,海关编码HScodeAgent等国产垂直Agent,正在增强中国中小企业的竞争力。数据显示,仅阿里国际旗下的AI Business团队,其提供的AI能力,可以帮中小企业解决60多个电商场景中遇到的问题,并在不同环节,带来1%-30%不等的显著提升。
正如我们之前访谈中所观察到的一样:越是中小企业,越能从AI的应用中获益。
公开资料显示,阿里国际的所有电商平台均已应用AI,已服务了超50万卖家,形成了以服务中小企业出海为核心,覆盖全球多元市场、多种电商模式的规模级AI应用。截至本月(2025年7月),阿里国际AI服务的调用量每两个月就会翻一番,平均日调用量已突破10亿次。这使得跨境电商成为第一个实现规模级AI应用的行业。
Agent时代,国产自研的AI产品,进一步完善了普通中国商家应对风险和变化的能力。
HS Code在国际贸易中极其重要,关系到商家的合规和效率。但并非每个企业都能拥有自己的HS Code顾问。
AI Agent无疑为这个问题提供了更多解。例如阿里国际旗下的海关编码HS code agent,可以利用Reasoning模型(推理模型)的Planning(任务拆解&步骤规划)、Tool Use(工具调用)、Reflection(自我迭代)能力,通过多轮调用工具不断自主探索,从工作环境中获取更为精确的信息,并不断更新步骤,以得到导向正确答案的路径。
数据显示,在HS code agent的帮助下,跨境商家们对10位HS code填写准确率提升了23%。
不过,谈到AI Agent的“未来”,张凯夫表示,做“最通用的”和“最垂直的”,其实都是可以的——最重要的是研发者和使用者明确人类使用AI的场景。“做非常通用的智能体,类似OpenAI ChatBot,没有任何问题;或者做特别垂直的,把自己专业领域的知识弄得非常明白——比较让人害怕的是夹在中间,因为夹在中间没有壁垒。”