日前,在“AIGC与场景化应用创新”主题研讨会上,阿里智能信息事业群夸克视觉技术负责人黄锐华分享了AI技术应用于扫描场景的最新成果。他表示,AIGC给手机扫描产品打开了创新空间,搭载大模型技术的夸克扫描王对识别手写字体、复杂公式和版式理解上的准确率达到了新高度。

夸克视觉技术负责人黄锐华
经过几十年的发展,扫描技术已经日趋成熟,但是随着拍摄屏幕等新场景和用户编辑图片等个性化需求的出现,扫描行业面临着全新的机会。尤其是大模型和AIGC在大数据建模、文本理解以及内容生产带来的颠覆性变化,将给用户和企业带来新一轮的效率提升。
黄锐华表示,夸克扫描王已形成扫描能力、图像能力、内容识别和版式理解能力及学习效率工具的能力矩阵。基于自身数据多、精度高、能力全等特点,夸克扫描王愿意将自研的多项技术和能力优先开放给行业伙伴,共同开创AIGC时代下的数字服务新生态。
众所周知,教育行业对扫描技术识别率、处理速度的要求非常高。黄锐华介绍,AIGC已经在扫描的识别精度、任务类型及应用场景等方面实现突破。以夸克扫描王的识别精度为例,目前手写字符识别准确率超过99%;复杂公式识别准确率99%;识别模糊文本和复杂公式的识别率远超行业水平。夸克扫描王在学习、工作等场景下的技术突破,正在加快推动生产力工具的智能化和数字化。
不久前,应用了最新AI大模型技术能力的夸克扫描王App上线。基于大语言模型的结果优化,夸克扫描王能够在复杂场景下模仿人类思维,更精准地识别、分析和提取文字、公式及图片等内容,从而实现更完美的扫描效果。
黄锐华透露,未来,夸克扫描王还会依托大模型技术在四方面进行持续突破。首先是扫描的能力,会覆盖更多真实的用户场景。其次是图像处理能力,让技术提升扫描质量。再次是内容理解能力,让大模型会像人一样去思考和解析内容。最后是提供更多智能化的工具,提升用户解决问题的效率。
据QuestMobile发布的《2023年轻人群智能效率应用研究》报告显示,夸克扫描王借助大模型技术加持,突破传统扫描仪的场景壁垒,满足年轻人群个性化需求,夸克中00后、90后人群占比位列同类产品第一。
 0赞
0赞好文章,需要你的鼓励
 推荐文章
                    推荐文章
                  英伟达和诺基亚宣布战略合作,将英伟达AI驱动的无线接入网产品集成到诺基亚RAN产品组合中,助力运营商在英伟达平台上部署AI原生5G Advanced和6G网络。双方将推出AI-RAN系统,提升网络性能和效率,为生成式AI和智能体AI应用提供无缝体验。英伟达将投资10亿美元并推出6G就绪的ARC-Pro计算平台,试验预计2026年开始。
印度理工学院研究团队从大脑神经科学的戴尔定律出发,开发了基于几何布朗运动的全新AI图像生成技术。该方法使用乘性更新规则替代传统加性方法,使AI训练过程更符合生物学习原理,权重分布呈现对数正态特征。研究团队创建了乘性分数匹配理论框架,在标准数据集上验证了方法的有效性,为生物学启发的AI技术发展开辟了新方向。
虽然ChatGPT等AI工具正在快速改变世界,但它们并非无所不知的神谕。ChatGPT擅长"令人信服的错误",经常提供有偏见、过时或完全错误的答案。在健康诊断、心理健康、紧急安全决策、个人财务规划、机密数据处理、违法行为、学术作弊、实时信息监控、赌博预测、法律文件起草和艺术创作等11个关键领域,用户应避免完全依赖ChatGPT,而应寻求专业人士帮助。
Sony AI开发出SoundReactor框架,首次实现逐帧在线视频转音频生成,无需预知未来画面即可实时生成高质量立体声音效。该技术采用因果解码器和扩散头设计,在游戏视频测试中表现出色,延迟仅26.3毫秒,为实时内容创作、游戏世界生成和互动应用开辟新可能。
 
             
                 
                     
                     
                    