中国电信人工智能研究院发布ShotPlan:让AI视频生成像导演一样懂得"切镜头"
ShotPlan是中国电信人工智能研究院与哈尔滨工业大学联合提出的多镜头视频生成框架,通过可学习规划令牌与分数时序位置编码,实现帧级精准镜头切换控制。
ShotPlan是中国电信人工智能研究院与哈尔滨工业大学联合提出的多镜头视频生成框架,通过可学习规划令牌与分数时序位置编码,实现帧级精准镜头切换控制。
原点 Talk 第四期聚焦 AI 落地“最后一公里”,讨论客户现场、工程验证与产品沉淀如何形成闭环
蚂蚁集团研究发现,双老师知识蒸馏训练会使AI助手产生"工具成瘾"——明明能直接回答的问题也去调用外部工具,提出Soft Clamp方法将乱调用率从14.2%降至9.0%。
山东大学团队构建了OCT-Bench,包含10076道题目,系统测试20个主流AI读懂眼底OCT扫描图的能力,揭示当前AI从图像识别到临床推理的显著落差。
俄罗斯SaluteDevices团队开发的GigaChat Audio,通过在音频输入中插入周期性时间锚点,实现了对最长120分钟录音的精准时间定位,误差中位数低至3秒,并已开源模型与数据集。
本文来自意大利国家核物理研究所,将Transformer架构翻译为微分几何语言,从ε参数到注意力汇聚点相变,用几何预测验证了大模型的稳定性机制。
南加州大学提出TOPL方法,通过逐词好坏分类训练替代传统文本生成目标,借助LoRA实现大模型事实准确性提升,在摘要和翻译任务的分布外场景中表现优异。
ReflectWorld-MM是一套面向持续视频流的实体中心多模态记忆系统,能追踪人和物体的身份、整合多层次情节与语义记忆,在六项长视频评测中全面超越现有方法。
高通技术公司与宝马集团宣布达成重要合作协议,高通将在未来十年内为宝马下一代数字座舱及高级驾驶辅助/自动驾驶系统提供计算芯片。合作涵盖骁龙数字底盘解决方案、骁龙Elite车载平台及专用AI加速器。双方此前已于2025年11...
上海电气在2026世界人工智能大会上展示了具身智能全栈解决方案,涵盖"溯源"双足人形机器人(41自由度)、"拓源"工业轮式人形机器人、"美人鱼"仿生轮式机器人及管道内壁倒角机器人等产品。同期发布51个"星云智造"系列AI...
对象存储软件公司MiniIO发布AIStor Memory,旨在解决AI智能体的持久化记忆难题。不同于普通聊天机器人,AI智能体需执行跨多会话的复杂多步骤任务,对持久记忆需求更为迫切。AIStor Memory将智能体记...
研究人员Aleksandr Churilov发现,Claude、GPT、Gemini、DeepSeek等五款主流大语言模型共同幻觉生成了127个相同的虚假PyPI和npm包名,这一现象被称为"slopsquatting"...
模型上下文协议(MCP)最新候选版本计划于7月28日发布,将移除协议级会话机制,转向无状态架构。此前基于会话的设计在本地开发中运行良好,但在多服务器生产环境中存在扩展瓶颈。新架构下,每个请求包含独立处理所需的全部信息,使...
IBM、UChicago、Qedma、Algorithmiq等机构联合发布三篇论文,展示了内置验证机制的量子优势实验。研究人员采用掺杂克利福德采样、时空码和误差缓解技术,在不依赖经典计算机验证的情况下,证明量子计算结果的...
美国道路安全倡导者指出,Flock Safety公司部署的车牌识别摄像杆存在严重安全隐患。这些黑色金属杆缺乏必要的"断裂板"安全装置,颜色深暗难以辨识,且部分安装位置不符合州交通部门规定的最小距离要求。安全专家史蒂夫·艾...
移动游戏已成为中国最主流的娱乐方式之一。高通公司全球副总裁侯明娟在开场致辞中特别指出:“移动电竞赛场是对骁龙游戏技术能力要求最严苛的试练场。骁龙的技术优势,从来不只是体现在硬核参数上,而是体现在那些真正决定胜负的瞬间——...