微软发布 Phi-3.5 系列模型,涵盖端侧、多模态、MOE;字节 Seed-ASR:自动识别多语言丨 RTE 开发者日报

本文主要是介绍微软发布 Phi-3.5 系列模型,涵盖端侧、多模态、MOE;字节 Seed-ASR:自动识别多语言丨 RTE 开发者日报,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

在这里插入图片描述

开发者朋友们大家好:

这里是 「RTE 开发者日报」 ,每天和大家一起看新闻、聊八卦。我们的社区编辑团队会整理分享 RTE(Real-Time Engagement) 领域内「有话题的 新闻 」、「有态度的 观点 」、「有意思的 数据 」、「有思考的 文章 」、「有看点的 会议 」,但内容仅代表编辑的个人观点,欢迎大家留言、跟帖、讨论。

本期编辑:@SSN,@鲍勃

01 有话题的新闻

1、微软发布 Phi-3.5-vision 轻量级、多模态的开源模型,端侧运行,可进行复杂视觉推理

微软发布 Phi-3.5-vision 轻量级、多模态的开源模型,其属于 Phi-3 模型家族。该模型专为需要文本和视觉输入的应用而设计,重点处理高质量、高推理密度的数据。它支持 128K 的上下文长度,并经过严格的微调和优化过程,旨在在内存或计算资源有限、低延迟要求高的环境中广泛用于商业和研究领域。

该模型具备广泛的图像理解、光学字符识别(OCR)、图表和表格解析、多图像或视频剪辑摘要等功能,非常适合多种 AI 驱动的应用,在图像和视频处理相关的基准测试中表现出显著的性能提升。

Phi 3.5 系列 AI 模型包括三款不同特点的模型:Phi-3.5-mini-instruct、Phi-3.5-MoE-instruct 和 Phi-3.5-vision-instruct。这些模型在 Hugging Face 平台上开源,并获得了 Microsoft 的 MIT 许可证,允许不受限制的商业应用和修改。

Phi-3.5-mini-instruct 是一款轻量级模型,拥有 38.2 亿参数,支持 128k token 上下文长度,适合在内存或算力受限的设备上使用,并且在多语言和多轮对话任务中表现良好。Phi-3.5-MoE-instruct 是微软 Phi 模型中的首个 MoE 模型,采用混合专家架构,拥有 420 亿个参数,专注于处理高质量推理密集数据,并在专业学科领域的 MMLU 基准测试中击败了 GPT-4o mini。Phi-3.5-vision-instruct 是一个多模态模型,集成了文本和图像处理功能,适用于图像理解、光学字符识别等任务,并在视觉任务基准测试中表现出色。(@雷锋网)

2、字节跳动 Seed-ASR:自动语音识别模型,可识别不同语言、方言、口音

字节跳动豆包近期推出的 Seed-ASR 是一款先进的自动语音识别模型,能够识别多种语言、方言和口音。Seed-ASR 通过超过 2000 万小时的语音数据和近 90 万小时的配对 ASR 数据进行训练,展现出了卓越的识别能力。

该模型支持精准识别普通话以及 13 种中国方言,同时具备处理各种口音的英语和其他 7 种语言的能力。Seed-ASR 还具备强大的上下文感知能力,能够根据特定场景,如历史对话记录、会议纪要等信息,更准确地进行语音内容的识别。此外,Seed-ASR 可以进一步部署以支持各种场景中的特定需求,而无需额外的语言模型。(@站长之家)

3、v0 发布一个基于聊天的网页开发助手,可生成用户界面、自动编写运行代码

v0 发布一个基于聊天的网页开发助手,用户可以通过聊天的方式与 v0 互动,让它帮助调试代码、回答开发问题、生成代码等,专门用于前端开发领域,可以为用户提供关于这些技术的深入指导和帮助。无论是编写代码、优化性能、部署应用,还是解决技术难题,v0 都能提供专业的支持和建议。

它拥有丰富的 TypeScript、React、Next.js、Vercel 等前端技术的知识。用户可以把 v0 视为个人的 web 开发助手,能够帮助处理与 web 开发相关的各种问题,提供建议、解决方案和技术支持。

v0 可以根据需求执行以下几种任务:

1.生成用户界面(UI):如果用户请求 v0 生成某种类型的 UI(如表单、按钮、布局等),它可以编写相应的代码,并生成 UI 的代码片段

2.运行代码:v0 可以帮助执行或运行代码段,提供实时反馈,帮助调试或验证代码的功能

3.回答编程相关问题:用户可以向 v0 提出关于 web 开发、前端技术(如 TypeScript、React、Next.js 等)的任何问题,v0 会一步步解答,帮助解决技术问题(@小互 AI)

4、Meta 部署新网络爬虫机器人,为其 AI 模型收集大量数据

Meta 悄悄发布了一款新的网络爬虫,可用于搜索互联网并收集大量数据,为其人工智能模型提供支持。

据三家追踪网络抓取器的公司称,Meta 新网络爬虫机器人 Meta External Agent 于上月推出,类似于 OpenAI 的 GPTBot,可以抓取网络上的人工智能训练数据,例如新闻文章中的文本或在线讨论组中的对话。

根据使用档案历史记录显示,Meta 确实在 7 月底更新了一个面向开发者的公司网站,其中一个标签显示了新爬虫的存在,但 Meta 至今还没有公开宣布其新爬虫机器人。

Meta 的 Llama 是最大的 LLM 之一,虽然该公司没有透露最新版本的模型 Llama 3 使用的训练数据,但其初始版本的模型使用了由 Common Crawl 等其他来源收集的大型数据集。今年早些时候,Meta 的联合创始人、首席执行官马克・扎克伯格在一次财报电话会议上曾吹嘘说,公司的社交平台已经积累了一套用于人工智能训练的数据集,甚至「超过了 Common Crawl」。

新爬虫的存在表明 Meta 庞大的数据库可能已经不够用了,因为该公司继续致力于更新 Llama 和扩展 Meta AI,通常需要新的和高质量的培训数据来不断改进功能。

来自 Dark Visitors 的数据显示,全球近 25% 的最受欢迎的网站现在已屏蔽了 GPTBot,但只有 2% 的网站屏蔽了 Meta 的新爬虫机器人。(@IT 之家)

5、Salesforce 推出 xGen-MM 开源多模态 AI 模型

在这里插入图片描述

xGen-MM 是由 Salesforce AI Research 开发的一系列最新的基础大型多模态模型(LMMs)。该系列在 BLIP 系列的成功设计基础上进行了改进,确保了更强大和更优越的基础。这些模型在高质量的图像标注数据集和交错的图像-文本数据上进行了大规模训练,能够执行各种视觉语言任务,并在基准测试中取得了竞争性表现。(@机器之心 SOTA 模型)

02 有态度的观点

1、谷歌 DeepMind 首席执行官兼联合创始人:AGI 将有助于理解宇宙和意识的奥秘,十年内治愈所有疾病

在 Google DeepMind 的播客中,谷歌 DeepMind 首席执行官兼联合创始人 Demis Hassabis 指出,尽管现代人工智能系统没有正确的世界模型或真实经验,却在理解抽象概念和从语言学习方面表现出异常的有效性。

Hassabis 对公众对人工智能的快速接受感到惊讶,并强调了 AI 聊天机器人和语言模型的「异常有效性」。他提到了 AI 领域的长期规划、代理和保障措施的挑战,并预测了大多数疾病和通用人工智能的治疗方法将在未来十年内开发出来。

Hassabis 强调了 AI 安全性的重要性,包括对 AGI 的谨慎态度、国际合作、适应性监管、以及对 AI 产品的测试和错误发现。他还讨论了人工智能对现实、物理和意识的基本问题的潜在解答能力,以及 AGI 在理解宇宙量子层面奥秘方面的应用。最后,他表示对 AGI 在未来十年内得到发展持乐观态度。(@雷锋网)

写在最后:

我们欢迎更多的小伙伴参与「RTE 开发者日报」内容的共创,感兴趣的朋友请通过开发者社区或公众号留言联系,记得报暗号「共创」。

对于任何反馈(包括但不限于内容上、形式上)我们不胜感激、并有小惊喜回馈,例如你希望从日报中看到哪些内容;自己推荐的信源、项目、话题、活动等;或者列举几个你喜欢看、平时常看的内容渠道;内容排版或呈现形式上有哪些可以改进的地方等。
在这里插入图片描述
素材来源官方媒体/网络新闻

这篇关于微软发布 Phi-3.5 系列模型,涵盖端侧、多模态、MOE;字节 Seed-ASR:自动识别多语言丨 RTE 开发者日报的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1097797

相关文章

Java实现字节字符转bcd编码

《Java实现字节字符转bcd编码》BCD是一种将十进制数字编码为二进制的表示方式,常用于数字显示和存储,本文将介绍如何在Java中实现字节字符转BCD码的过程,需要的小伙伴可以了解下... 目录前言BCD码是什么Java实现字节转bcd编码方法补充总结前言BCD码(Binary-Coded Decima

修复已被利用的高危漏洞! macOS Sequoia 15.6.1发布

《修复已被利用的高危漏洞!macOSSequoia15.6.1发布》苹果公司于今日发布了macOSSequoia15.6.1更新,这是去年9月推出的macOSSequoia操作... MACOS Sequoia 15.6.1 正式发布!此次更新修复了一个已被黑客利用的严重安全漏洞,并解决了部分中文用户反馈的

GO语言短变量声明的实现示例

《GO语言短变量声明的实现示例》在Go语言中,短变量声明是一种简洁的变量声明方式,使用:=运算符,可以自动推断变量类型,下面就来具体介绍一下如何使用,感兴趣的可以了解一下... 目录基本语法功能特点与var的区别适用场景注意事项基本语法variableName := value功能特点1、自动类型推

GO语言中函数命名返回值的使用

《GO语言中函数命名返回值的使用》在Go语言中,函数可以为其返回值指定名称,这被称为命名返回值或命名返回参数,这种特性可以使代码更清晰,特别是在返回多个值时,感兴趣的可以了解一下... 目录基本语法函数命名返回特点代码示例命名特点基本语法func functionName(parameters) (nam

Go语言连接MySQL数据库执行基本的增删改查

《Go语言连接MySQL数据库执行基本的增删改查》在后端开发中,MySQL是最常用的关系型数据库之一,本文主要为大家详细介绍了如何使用Go连接MySQL数据库并执行基本的增删改查吧... 目录Go语言连接mysql数据库准备工作安装 MySQL 驱动代码实现运行结果注意事项Go语言执行基本的增删改查准备工作

Go语言使用Gin处理路由参数和查询参数

《Go语言使用Gin处理路由参数和查询参数》在WebAPI开发中,处理路由参数(PathParameter)和查询参数(QueryParameter)是非常常见的需求,下面我们就来看看Go语言... 目录一、路由参数 vs 查询参数二、Gin 获取路由参数和查询参数三、示例代码四、运行与测试1. 测试编程路

Go语言使用net/http构建一个RESTful API的示例代码

《Go语言使用net/http构建一个RESTfulAPI的示例代码》Go的标准库net/http提供了构建Web服务所需的强大功能,虽然众多第三方框架(如Gin、Echo)已经封装了很多功能,但... 目录引言一、什么是 RESTful API?二、实战目标:用户信息管理 API三、代码实现1. 用户数据

Mybatis-Plus 3.5.12 分页拦截器消失的问题及快速解决方法

《Mybatis-Plus3.5.12分页拦截器消失的问题及快速解决方法》作为Java开发者,我们都爱用Mybatis-Plus简化CRUD操作,尤其是它的分页功能,几行代码就能搞定复杂的分页查询... 目录一、问题场景:分页拦截器突然 “失踪”二、问题根源:依赖拆分惹的祸三、解决办法:添加扩展依赖四、分页

Go语言网络故障诊断与调试技巧

《Go语言网络故障诊断与调试技巧》在分布式系统和微服务架构的浪潮中,网络编程成为系统性能和可靠性的核心支柱,从高并发的API服务到实时通信应用,网络的稳定性直接影响用户体验,本文面向熟悉Go基本语法和... 目录1. 引言2. Go 语言网络编程的优势与特色2.1 简洁高效的标准库2.2 强大的并发模型2.

Go语言使用sync.Mutex实现资源加锁

《Go语言使用sync.Mutex实现资源加锁》数据共享是一把双刃剑,Go语言为我们提供了sync.Mutex,一种最基础也是最常用的加锁方式,用于保证在任意时刻只有一个goroutine能访问共享... 目录一、什么是 Mutex二、为什么需要加锁三、实战案例:并发安全的计数器1. 未加锁示例(存在竞态)