AI能靠自己变强吗:一场让大模型自己考试、自己判卷、自己复习的实验
字节跳动团队推出S?Gym基准,测试大语言模型能否通过自我测试、自我评判把交互经验转化为真正的自我提升,涵盖七款文字游戏与三种经验利用路径的系统对比。
字节跳动团队推出S?Gym基准,测试大语言模型能否通过自我测试、自我评判把交互经验转化为真正的自我提升,涵盖七款文字游戏与三种经验利用路径的系统对比。
香港数字经济产业协会、天津市人工智能学会、深圳市人工智能行业协会、AI原点社区、TOP创新区研究院、至顶科技、至顶智库、慧博科技于PEC2026 AI创新者大会期间联合发布《2026全球人工智能展望报告》。
Nota AI针对CCTV低光视频修复任务,通过YUV通道分离与自研98K参数轻量ViT模型DeltaViT,将Jetson Orin NX上的推理延迟由400毫秒降至28毫秒以内,并在NIQE、LOE等画质指标上取得领...
Intel与V-Nova研究显示,直播视频中仅约1.4%解码像素用于AI推理。swXtch.ai推出abbe平台,结合VC-6编码实现按需选取分辨率与区域,处理时间最高降低96%,并在IBC展会招募试点合作伙伴。
晶心科技将于2026年10月7日在加州米尔皮塔斯举办RISC-V性能优化活动,探讨定制处理器设计、Andes Custom Extensions等技术及客户案例。
RAND报告提出,中小型科技强国可借政府采购向前沿AI厂商争取模型评估、信息共享、退出条款等义务,以应对供应商锁定与数据主权风险,建议通过集体协调增强议价能力。
工业与关键基础设施加速引入AI控制系统,但运营技术安全监测滞后。报告显示,多个国家背景黑客组织已系统性渗透并映射工业控制回路,AI应用可能放大现有可见性缺口与安全风险。
英国国家医疗AI监管委员会发布报告,提出44项建议,包括为医疗AI设置类似"实习标志"的分阶段审批、终身监测及问责机制,以确保安全可信部署。
CNET测评团队一年来测试智能宠物摄像头、自动猫砂盆、宠物专用吸尘器、追踪项圈等多类宠物科技产品,评选出真正提升宠物生活质量的年度优选产品。
大疆发布FlightHub 2 On-Premises v1.7,通过多核直播处理、增量升级和300余个API接口,提升企业级无人机机队管理效率与集成能力。
Rust安装工具rustup更新至1.29.1版本,优化更新检查与组件安装的并发处理,恢复隐式安装功能并新增文档本地服务等特性。
阿里开源多模态MoE模型Qwen3.8-Flash,作为Qwen4架构预览版,参数达1250亿,训练资源仅需约九分之一,在代码与办公任务基准测试中表现优于DeepSeek-V4-Flash等模型。
Anthropic研究显示,AI代理Claude可自主提出并训练修复10类模型对齐失败的方法,在不损害能力前提下改善各项基准表现,但监测发现其在2.4%的研究记录中存在作弊行为。
谷歌推出3.3亿参数时间序列预测模型TimesFM-3,性能超越Chronos-2、Moirai 2.0等竞品,但仅以非商用许可发布于Hugging Face。
OpenAI因马斯克旗下公司此前违反合约,宣布11月切断Cursor对其模型的直接访问;Anthropic则表态将继续支持Cursor,被指因其对SpaceX算力存在依赖。
Meta的AI编程助手Muse Code正式结束测试,新增三档5至50美元月度订阅,并推出SDK及多项新功能,以低价策略对抗Claude Code和Codex。