这个 API 是什么?谁发布的?

2024 年 11 月 7 日,Mistral AI 团队发布了一个叫 Mistral Moderation API 的新工具。它是一个内容审核接口,专门用来检查文字里有没有不合适的内容。你可以把它想象成给 AI 应用请了一位懂多国语言的保安,专门检查说的话是否合适,把不好的内容挡在门外。

这个 API 是闭源服务,不是开源模型,也不是开放权重。它和 Le Chat 里用的审核服务是同一个,现在开放给开发者使用,让大家可以把它接到自己的应用里,按照自己的安全标准来调整。

它怎么工作?原理是什么?

Mistral Moderation API 的核心是一个大语言模型分类器。你给它一段文字,它会判断这段文字属于哪一类内容。官方说它能把文字分成 9 个类别,但原文没有列出这 9 个类别的具体名字。它有两个接口:一个处理普通文本,一个处理对话内容。

对于对话内容,它会特别关注对话中的最后一条消息,因为不合适的内容往往和上下文有关。比如同样一句话,在朋友聊天里可能没问题,在正式场合就不合适。这个模型会结合对话背景来判断。

它天生支持多种语言,官方特别提到训练时用了阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。所以它就像一个会多国语言的保安,不管你说哪种语言,它都能听懂并检查。

它能做什么?有什么用途?

这个 API 的主要用途是帮助开发者给 AI 应用加上安全护栏。比如你做了一个聊天机器人,你可以用这个 API 在机器人回复用户之前先检查一遍,如果发现不合适的内容就拦下来。它还能识别模型自己生成的有害内容,比如不专业的建议或者个人隐私信息。

官方说,不合适的内容和具体场景关系很大,所以这个模型被训练成在对话背景下判断最后一条消息。这意味着它不只是看单个词,而是看整段对话的意思。开发者可以根据自己的应用场景和安全标准来定制使用方式。

它的表现怎么样?

官方在博客里分享了内部测试集上的 AUC PR 数据,用来展示模型在不同政策类别上的表现。但原文没有给出具体的数值,只放了一张图,图上显示 0%。这可能是图片加载问题,也可能是数据展示方式,但原文没有进一步解释。

官方表示,他们正在和客户一起构建可扩展、轻量且可定制的审核工具,并会继续和研究社区合作,为更广泛的领域贡献安全方面的进步。这说明这个 API 还在持续改进中。

有什么限制和不确定的地方?

原文没有说明这个 API 的具体定价、调用次数限制、是否提供免费试用额度。也没有说模型有多大、训练数据具体是什么。9 个类别的具体名称也没有列出,只说了有 9 类。

另外,原文没有明确说这个 API 是否开源或开放权重,从描述看它是一个闭源服务。也没有提到是否支持图片或视频审核,看起来目前只处理文字。这些信息都需要看技术文档才能确认,但原文没有提供文档链接。

适合谁用?怎么开始?

这个 API 适合开发者、AI 应用团队、以及任何需要给文字内容加安全护栏的人。比如做社交平台、聊天机器人、在线教育、客服系统的团队都可以用。它特别适合需要多语言支持的场景,因为原生支持十几种语言。

官方说,完整的政策定义和如何开始使用的细节都在技术文档里。但原文没有给出文档链接,也没有说明是否需要申请或付费。如果你想用,可能需要去 Mistral AI 的官网找开发者文档,或者联系他们的销售团队。

为什么这件事重要?

Mistral AI 认为,安全是让 AI 变得有用的关键。系统级别的护栏对保护下游部署非常重要。这个 API 的发布,意味着开发者可以更方便地把内容审核集成到自己的应用里,而不需要自己从头训练一个审核模型。

过去几个月,业界和研究社区对基于大语言模型的审核系统越来越感兴趣,因为这种方法可以更可扩展、更稳健。Mistral 的这个 API 就是顺应这个趋势,把内部用的审核能力开放出来,让更多人能用上。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗