推出全多模态的Clef-omni ,以及更快的Clef和更便宜的Clef-flash

我们正在使用Clef-omni扩展Clef决策模型系列,在单个管道中本地处理音频、视频、图像和文本。我们还降低了Clef-flash定价,并将Clef推理速度提高了2.0倍。

继上周发布Cloudflare的开放式决策模型Clef和Clef-flash之后,我们决定推出更多礼物。今天,我们发布了Clef-omni,它可以接收音频和视频输入以及文本和图像。我们还降低了Clef-flash的价格,因此它现在比Jev便宜,我们使Clef更快。

虽然Cloudflare的模型游戏还为时尚早,但创新和迭代是我们的DNA,我们将这些原则应用于我们所做的一切。事实上, Clef的故事在不到一周的时间里汇集在一起。我们决定在周五晚上在决策模型空间中做一些事情,在周末训练模型,并在周四推出。

即使在如此短的时间内,我们也能够为社区提供高性能、高质量、开放式的模型--想象一下我们未来还能做些什么。今天,我们很高兴能够通过Clef系列车型的新增和改进来保持这一势头。这只是一个开始,我们将继续变得更好、更快、更便宜、更具创新性。

Clef-omni采集音频、视频、图像和文本输入我们的新型Clef-omni模型能够采集音频、视频、图像和文本输入。这改变了决策模型的范式,自从TypeSafe的Jev首次亮相以来,决策模型基本上都是纯文本的。使用Clef,我们支持图像和视频帧数组,但Clef-omni能够接收音频( wav或mp3 )和视频( mp4或webm )以及文本和图像。

无需设置将语音转录为文本的模型级联管道,或从视频中拆分音频和图像通道,您只需调用一个模型即可跨任何模式做出决策。我们现在距离能够通过音频、视觉和文本交流与我们体验的世界互动的模型又近了一步。查看我们的开发人员文档,了解新的Clef-omni模型。