日前,在“AIGC与场景化应用创新”主题研讨会上,阿里智能信息事业群夸克视觉技术负责人黄锐华分享了AI技术应用于扫描场景的最新成果。他表示,AIGC给手机扫描产品打开了创新空间,搭载大模型技术的夸克扫描王对识别手写字体、复杂公式和版式理解上的准确率达到了新高度。

夸克视觉技术负责人黄锐华
经过几十年的发展,扫描技术已经日趋成熟,但是随着拍摄屏幕等新场景和用户编辑图片等个性化需求的出现,扫描行业面临着全新的机会。尤其是大模型和AIGC在大数据建模、文本理解以及内容生产带来的颠覆性变化,将给用户和企业带来新一轮的效率提升。
黄锐华表示,夸克扫描王已形成扫描能力、图像能力、内容识别和版式理解能力及学习效率工具的能力矩阵。基于自身数据多、精度高、能力全等特点,夸克扫描王愿意将自研的多项技术和能力优先开放给行业伙伴,共同开创AIGC时代下的数字服务新生态。
众所周知,教育行业对扫描技术识别率、处理速度的要求非常高。黄锐华介绍,AIGC已经在扫描的识别精度、任务类型及应用场景等方面实现突破。以夸克扫描王的识别精度为例,目前手写字符识别准确率超过99%;复杂公式识别准确率99%;识别模糊文本和复杂公式的识别率远超行业水平。夸克扫描王在学习、工作等场景下的技术突破,正在加快推动生产力工具的智能化和数字化。
不久前,应用了最新AI大模型技术能力的夸克扫描王App上线。基于大语言模型的结果优化,夸克扫描王能够在复杂场景下模仿人类思维,更精准地识别、分析和提取文字、公式及图片等内容,从而实现更完美的扫描效果。
黄锐华透露,未来,夸克扫描王还会依托大模型技术在四方面进行持续突破。首先是扫描的能力,会覆盖更多真实的用户场景。其次是图像处理能力,让技术提升扫描质量。再次是内容理解能力,让大模型会像人一样去思考和解析内容。最后是提供更多智能化的工具,提升用户解决问题的效率。
据QuestMobile发布的《2023年轻人群智能效率应用研究》报告显示,夸克扫描王借助大模型技术加持,突破传统扫描仪的场景壁垒,满足年轻人群个性化需求,夸克中00后、90后人群占比位列同类产品第一。
好文章,需要你的鼓励
新加坡人工智能机构与阿里云发布全新大语言模型Qwen-Sea-Lion-v4,专门针对东南亚语言和文化特色进行优化。该模型结合阿里云Qwen3-32B基础模型和大量东南亚地区数据集,在东南亚语言模型评估榜单中位居开源模型首位。模型支持119种语言,能在32GB内存的消费级笔记本上运行,采用字节对编码技术更好处理非拉丁文字,并具备3.2万词元上下文长度,可执行文档级推理和摘要任务。
中科大联合快手等机构推出VR-Thinker技术,首次实现AI视频评判员的"边看边想"能力。该系统通过主动选择关键画面、智能记忆管理和三阶段训练,在视频质量评估准确率上达到75%-82%,特别擅长处理长视频场景,为AI视频生成的质量控制提供了突破性解决方案。
AI智能体是下一代业务自动化工具,不仅能对话交流,还能执行复杂任务。与ChatGPT聊天机器人不同,它们可在最少人工干预下规划并完成工作。文章介绍了五个高影响力应用:自动化客户服务解决方案、销售CRM管理、合规自动化、招聘筛选与排程、市场情报报告。这些应用都具有重复性工作流程、依赖结构化数据、遵循可预测规则等特点,能够释放员工宝贵时间用于更有价值的工作。
微软研究院发布BitDistill技术,通过三阶段优化将大型语言模型压缩至1.58位精度,在保持性能的同时实现10倍内存节省和2.65倍速度提升。该技术包括模型结构稳定化、持续预训练适应和知识蒸馏传承三个关键步骤,解决了模型量化中的性能衰减和规模化问题,为AI模型在资源受限设备上的高效部署提供了新方案。