AI行业

阿里语音大模型夺魁,AI降本与毁书争议齐飞

阿里千问AI平台最近上了个Qwen-Audio-3.0系列语音模型,火气挺大,一口气拿下了Artificial Analysis 7月榜单的语音识别、实时交互和语音合成三项第一。模型能力是越来越猛,但企业那边算盘也打得很响。说白了,大家现在不只看效果,更怕烧钱。服务商Writer脑子转得快,基于开源的GLM-5.2搞了个Palmyra X6。他们升级了智能代理的运行框架,硬生生把企业基础任务的Token成本砍掉一半,专治AI“越用越贵”的毛病。

性能和价格卷完,底层技术还得往下扎根。实际上,现在有研究开始盯上跨会话的上下文学习状态交接了。啥意思?就是为了解决长任务换了个新会话后该怎么接茬的问题。另外,评估方法也在变细致。以前看隐喻解释,都是给个总分了事,现在学术界弄出了个认知驱动的多维框架,直接去扒人类判断里到底哪些是共识,哪些存在分歧。

想让大模型变强,喂饱数据是绝对的关键。但有时这获取手段,真挺极端的。调查人员靠AirTag追踪发现,像亚马逊这些大公司,买来纸质书直接就把书脊给切了,扫完内容就喂给AI。虽然法院那边裁定说扫描属于合理使用,可那些不可替代的珍贵原书就被这么物理毁掉了,引发了不小的争议。技术一路狂奔,数据到底该怎么搞,依然是个死结。