20260806 AI 资讯快报

2026-08-06 · 实时更新

阿里推出原生 Computer Use Agent「Qwen-CUA」

阿里 Qwen 团队联合 XLang Lab 推出原生 Computer Use Agent「」,基于 397B-A17B 混合专家架构,通过屏幕截图感知界面状态,无需依赖 DOM 树或无障碍元数据,直接输出键盘鼠标事件操控浏览器、桌面及专业软件。模型在 OSWorld-Verified 基准取得 86.2 分,万亿参数 Max 版本达 87.6 分。


腾讯混元推出新一代语音识别模型 Hy ASR 3.0 preview

腾讯混元推出新一代语音识别模型,模型基于大语言模型打造,深度融合语音识别与深度语义理解能力,在中文普通话、英语及粤语等场景的识别准确率均达到业界顶尖水平,具备复杂语境下的智能纠错能力。


阿里千问图像生成模型 Qwen-Image-3.0 上线千问AI平台

阿里巴巴千问图像生成模型上线千问AI平台,面向所有用户免费开放。旗舰版Qwen-Image-3.0-Pro与标准版Qwen-Image-3.0-Standard同步开放API。在国际评测平台Arena.ai最新文生图榜单中,模型位列国内第一、全球第五。


字节跳动推出音视频全双工大模型 SeedRealtime

字节跳动 Seed 推出原生音视频全双工大模型 ,基于统一架构原生融合音频、视频与文本,实现”边看、边听、边说”的实时多模态交互。模型具备音视频联合理解、主动交互与流畅对话节奏三大核心能力,端到端评测显示对话节奏问题较级联模型减少一半。


Mistral AI 开源多模态内容审核模型 Shieldstral

Mistral AI 开源多模态内容审核模型 ,支持 12 种语言且单张 16GB GPU 可运行。模型在多模态审核领域达到 SOTA,性能媲美 7 倍规模竞品;创新性地将审核策略用自然语言问题形式输入,通过”是/否”问答机制输出校准安全分数,支持提示词分类、回答审核与毒性检测等任务。


京东开源实时流式视频编辑模型 JoyAI-Video-Edit

京东开源自研实时流式视频编辑模型,支持视频边播边改,在 720P 分辨率下实现每秒 30 帧推理,可处理任意时长视频。模型在 OpenVE-Bench 评测中全面领先 SANA Streaming、LiveEdit 等同类流式模型,编辑质量达到离线模型水平。