微软公司日前发布了Phi-4的代码。Phi-4是一个可以生成文本并解决数学问题的小型语言模型。
微软上个月首次详细介绍了Phi-4模型。最初的Phi-4只能通过微软的Azure Foundry人工智能开发服务访问。现在,Phi-4模型可以从Hugging Face下载。Hugging Face是一个托管开源人工智能项目的热门网站。
Phi-4是微软于2023年推出的小型语言模型系列的第四代版本,拥有140亿个参数,这些参数设定决定了神经网络如何处理数据。微软的研究人员利用英伟达公司提供的1,920块H100图形处理器集群,花了21天训练Phi-4。
Phi-4模型基于行业标准的 Transformer 架构。Transformer架构是大多数大型语言模型的基础。Transformer 模型收到用户提示后会将输入分解为单个单词,并通过分析上下文的文本确定每个单词的含义。这种模型还会优先处理上下文文本中被认为最相关的部分。
Phi-4采用的是所谓纯解码器的Transformer架构变体。标准的Transformer模型会分析单词前后的文本来确定其含义。纯解码器模型则只关注单词之前的文本,从而减少了需要处理的数据量,降低了推理成本。
微软在一份研究论文中详细介绍了如何使用两种后训练优化技术提升Phi-4的输出质量。这两种方法分别被称为直接偏好优化和监督微调。两种方法都需要向语言模型提供示例,用于指导模型如何生成符合要求的即时响应。
微软在一次内部评估中将Phi-4与Llama 3.3 70B 进行了比较,后者的参数是Phi-4的五倍。微软表示,在常用的GPQA和MATH基准测试中,Phi-4的表现更好。GPQA和MATH两个测试数据集分别包含科学问题和数学问题。
在过去一年中,各大科技公司争相开源了越来越多的小型语言模型,Phi-4 也正式加入了这一行列。
谷歌公司去年二月推出了一系列名为 Gemma 的小型语言模型。Gemma系列模型的算法拥有20亿到270亿个参数。谷歌表示,270亿个参数的Gemma版本在性能上优于参数数量是其两倍的模型。
Meta Platforms 公司最近发布了两个参数少于 50 亿 Llama 3.2 模型。随后,Meta又开源了这些模型的更高效版本,这些版本实现了机器学习里的量化技术。量化技术可以压缩神经网络获取的数据,减少处理数据所需的硬件数量。
好文章,需要你的鼓励
新加坡国立大学研究人员开发出名为AiSee的可穿戴辅助设备,利用Meta的Llama模型帮助视障人士"看见"周围世界。该设备采用耳机形态,配备摄像头作为AI伴侣处理视觉信息。通过集成大语言模型,设备从简单物体识别升级为对话助手,用户可进行追问。设备运行代理AI框架,使用量化技术将Llama模型压缩至10-30亿参数在安卓设备上高效运行,支持离线处理敏感文档,保护用户隐私。
阿里巴巴联合浙江大学开发的OmniThink框架让AI学会像人类一样慢思考写作。通过信息树和概念池的双重架构,系统能够动态检索信息、持续反思,突破了传统AI写作内容浅薄重复的局限。实验显示该方法在文章质量各维度均显著超越现有最强基线,知识密度提升明显,为长文本生成研究开辟了新方向。
OpenAI推出新AI模型GPT-5-Codex,能够在无用户协助下完成数小时的编程任务。该模型是GPT-5的改进版本,使用额外编码数据训练。测试显示,GPT-5-Codex可独立工作超过7小时,能自动发现并修复编码错误。在重构基准测试中得分51.3%,比GPT高出17%以上。模型可根据任务难度调整处理时间,简单请求处理速度显著提升。目前已在ChatGPT付费计划中提供。
腾讯混元3D 2.0是一个革命性的3D生成系统,能够从单张图片生成高质量的带纹理3D模型。该系统包含形状生成模块Hunyuan3D-DiT和纹理合成模块Hunyuan3D-Paint,采用创新的重要性采样和多视角一致性技术,在多项评估指标上超越现有技术,并提供用户友好的制作平台。作为开源项目,它将大大降低3D内容创作门槛,推动3D技术的普及应用。