内容持续更新中
人工智能企业 xAI 近日宣布推出新一代语音识别与生成模型Grok Voice Think Fast 2.0,并全面向开发者开放。该模型在智能水平、转录准确率、对话交互能力及工具调用效率等方面实现了显…
语音交互正迎来新的技术跨越。近日,通义千问大模型正式宣布升级其核心音频能力,推出了全新的实时语音识别模型 Fun-ASR-Realtime。 该模型在性能指标上实现了显著突破,其首字识别延迟被精准控制…
近日,播客应用 Overcast 的开发者 Marco Arment 选择自建一个由 48 台 Mac mini 组成的服务器集群,来应对云端 AI 服务所带来的高昂成本。Arment 指出,使用云端…
近日,微信的元宝 AI 助手宣布了新功能,用户现在可以通过一句话在微信中设置提醒。只需向元宝发送包含事项及时间的消息,元宝就能自动识别任务内容,并在指定时间通过微信服务通知提醒用户。这一功能的推出,让…
智谱 AI 正式推出了其最新的 GLM-ASR 系列语音识别模型,并将相关技术开源,旨在为广大用户提供更高效的语音交互体验。这一系列的推出还包括了一款桌面端的 “智谱 AI 输入法”,为用户在 PC …
近年来,美国一家名为 Securus Technologies 的电信公司,秘密地利用监狱内囚犯的电话和视频通话记录,构建其专有的人工智能模型。根据《麻省理工科技评论》的报道,Securus 自202…
字节跳动旗下“豆包输入法”近日宣布正式上线,安卓用户现已可通过官网和各大应用商店下载体验,iOS版本也将于近期推出。这款输入法基于豆包App同款语音模型,旨在提供更准确的语音识别、语义理解,以及全面提…
在2025年科大讯飞1024开发者节上,科大讯飞正式发布AI软硬一体解决方案,通过AI算法与硬件架构的深度融合,实现了在高噪声、远场等复杂环境下的精准识别与理解。这一突破被视为语音与视觉智能融合领域的…
近日,阿里通义 Qwen 团队发布了一款名为 Qwen3-ASR-Toolkit 的开源 Python 命令行工具。这款工具旨在为用户提供更为便捷的音视频转录服务,特别是在音频时长方面,突破了 Qwe…
近日,OpenAI 的 Evals 工具迎来了令人振奋的重大更新,新增了原生音频输入和评估功能。这一创新意味着开发者们在测试和优化语音识别与生成模型时,可以直接使用音频文件进行评估,而无需经过繁琐的文…
近日,通义大模型发布CoGenAV,以音画同步理念创新语音识别技术,有效解决语音识别中噪声干扰的难题。 传统语音识别在噪声环境下表现欠佳,CoGenAV则另辟蹊径,通过学习audio-visual-t…
最近,SoundHound AI, Inc.(NASDAQ:SOUN)在人工智能领域获得了显著认可,特别是在 AIOps(人工智能运维)方面的表现。然而,尽管在技术上取得了一定的成就,市场对其未来的预…
据tech星球消息,阿里通义实验室语音团队负责人鄢志杰已于 2 月 15 日正式离职,其职级为阿里原P序列体系中的P10 级别。 鄢志杰是智能语音领域专家, 2003 年进入中科大语音实验室攻读博士,…
在语音识别领域,中文识别的技术发展一直备受关注。近日,小红书的 FireRed 团队发布了一个全新的开源语音识别模型 ——FireRedASR。这个基于大模型的语音识别系统在多个标准测试集上取得了优异…
今日,豆包大模型官方发布豆包大模型的8个关键时刻!自2024年5月15日首次亮相以来,豆包大模型已破土而出,历经230天加速成长。从初步的学语,到懵懂的世界探索,再到为创作者绘制奇幻梦境,这一路的每一…
Deepgram日前发布了一款革命性的AI语音代理API,为企业和开发者带来了前所未有的自然对话体验。这款API整合了先进的语音识别和合成技术,支持实时对话理解和生成,为构建高效语音助手开辟了新天地,…
摩尔线程近日宣布开源其音频理解大模型MooER(摩耳),成为业界首个基于国产全功能GPU训练和推理的大型开源语音模型。MooER不仅支持中英文语音识别,还具备中译英的语音翻译能力,展现了强大的多语言处…
语音识别技术一直是人工智能发展的重点领域之一。而如今,字节跳动推出的Seed-ASR引擎,正在彻底打破语言和方言的壁垒,为这项技术注入全新活力。 Seed-ASR经过了超过2000万小时的语音数据和近…
近日,阿里巴巴在其 Qwen-Audio 的基础上,推出了全新的开源语音模型 Qwen2-Audio。这款模型不仅在语音识别、翻译和音频分析方面表现出色,更是在功能和性能上实现了显著提升。Qwen2-…
以色列人工智能公司 aiOla 近日在语音识别技术领域取得重大突破,推出了名为 Whisper Medusa 的开源语音识别模型。这款新模型的处理速度比 OpenAI 的 Whisper 模型快50%…
腾讯云最新推出的语音识别系统 ASR 进行了升级,提高了处理方言和噪声的能力。ASR 支持识别 23 种地方言,并能应对方言混战的情况。通过自研的混合识别引擎,ASR 能快速识别并切换不同方言。采用蒸…
近期,利用活人脑细胞构建的AI系统在Nature子刊登上前沿类脑研究,语音识别准确率从30%-40%飙升至78%。该系统可进行无监督学习,类似神经网络,并依赖脑类器官中神经细胞的连接来实现学习。经过两…
亚马逊最新ASR系统覆盖100多语言,通过语音基础模型实现显著准确度提升。系统支持多项特性,成千上万企业利用该系统解锁音频内容见解,提高了可访问性和可发现性。
来源:bilibili哔哩哔哩 作者:@极客湾Geekerwan 视频时长/时间:00:20:26/ 2023-04-30 【内容介绍】 视频讲解了up主使用ChatGPT+VITS语音生成+基于BE…
来源:bilibili哔哩哔哩 作者:@通义听悟 视频时长/时间:00:02:15 / 2023-06-20 【内容介绍】 通义听悟可以在会议、学习、访谈、培训等场景下: 实时记录交流内容,同步翻译 …
随着人工智能技术的发展,电话诈骗者可以利用生成式AI来伪造熟悉声音,进行所谓的“声音网络钓鱼”欺诈。这种新的威胁对普通民众带来了巨大的挑战。为了应对这一风险,技术公司正在研发识别模式,找到阻止这种骗局…
Meta 开源了全球最大的多模式翻译大模型 SeamlessM4T,支持 100 种语言,并能识别地方语言。该模型能执行语音到文本、语音到语音、文本到语音和文本到文本的多模式翻译任务。Seamless…