至顶网软件频道消息: 微软在公布预览的时候将这个第二代版本称为“不折不扣的数据湖”。据悉,Azure Data Lake是微软用于云中大数据分析工作负载的存储库。

Azure Data Lake Storage Gen2将第一代Azure Data Lake的核心功能与兼容Hadoop的文件系统端点(直接集成到Azure Blob Storage)进行了统一。
微软在一篇博客文章中解释说:“这些增强功能将对象存储的规模和成本优势与通常只和本地文件系统相关联的可靠性及性能相结合。这个新的文件系统包括一个完整的分层命名空间,让文件和文件夹优先级最高,转化为更快速、更可靠的分析任务执行。”
Gen2还为客户带来“无限存储”以及与Azure Active Directory的本地集成。
微软在2015年宣布了Azure Data Lake Service的初始计划。第一代Azure Data Lake旨在与HDInsight配合,这是微软针对Windows和Linux的Hadoop-onAzure服务。 最初Azure Data Lake是建立在微软内部“Cosmos”大数据存储和分析服务基础之上的。
除此之外,微软还宣布推出了Azure Data Factory V2的几项新功能,包括支持控制流数据管道结构;无码数据迁移和编排设计;灵活调度。
据悉,Azure Data Factory是一种混合数据集成(ETL)服务。将通过与世纪互联的合作在中国现有两个Azure区域基础上再增加两个。
好文章,需要你的鼓励
牛津大学提出PHYSIFORMER,一种扩散变换器模型,通过三维网格顶点轨迹直接在世界坐标空间预测刚性与弹性物体的物理运动,一次性生成全序列轨迹,超越自回归基线。
随着医疗数据数字化与互操作性的进步,跨机构纵向患者数据的研究应用成为可能。本研究通过对20位领域专家的访谈,识别出8种数据收集方法,涵盖智能手机应用、结构化数据导出、区域/全国研究查询及聚合数据源等。研究发现,各方法均有其优缺点,无单一最优方案。参与者中介交换方式可绕过复杂治理安排,但存在数据缺口;全国性网络尚不支持研究查询。公共政策的持续推进将对该领域发展起关键作用。
研究发现主流奖励模型对同等质量答案给出差异悬殊的分数,并提出"奖励聚类"算法通过蒙特卡洛随机失活将连续分数离散化,在不重训模型的前提下有效减少AI训练中的奖励作弊现象。