Elasticsearch 9.0 和 8.18:专为开发者打造,性能提升显著,比 OpenSearch 快 5 倍

我们自豪地向 Elastic Cloud 及自管用户发布 Elasticsearch 9.0 和 8.18 版本。这两个版本中的各项功能已向我们的 Elastic Cloud Serverless 用户提供,这些用户已能够在 AWS、Azure 和 GCP 上使用正式发布、全面托管的 Elasticsearch。
提供更优质的二进制量化 (BBQ) 服务,速度更快——比 OpenSearch 快 5 倍
BBQ(更好的二进制量化)最初在 8.16 版本中作为技术预览版推出,现在已正式发布,为传统的量化技术(例如乘积量化 (PQ))提供了一种高性能的替代方案。
我们的客户,例如 Roboflow ,需要存储和更新数量日益庞大(例如数十亿)的向量数据。过去,他们不得不考虑使用类似 PQ 的解决方案来保持数据的相关性和性能,并更有效地利用现有硬件。现在,他们可以使用 BBQ 了。
BBQ 现在采用了更新的算法,使用 SIMD 可将召回率提高多达 20%,吞吐量提高了 8 至 30 倍,可实现高效、准确的搜索。Elastic 是第一家实施这种方法的向量数据库供应商,它使实际的搜索工作负载能够更快地获得结果,同时减少计算资源消耗。
为了实现将 Apache Lucene 打造成最佳向量数据库的使命,并作为将这些创新带给社区的倡导者,我们最近已将这些功能合并到 Lucene 中。
与 OpenSearch FAISS 相比,Elasticsearch BBQ 在所有召回级别下都能提供高达 5 倍的查询速度和 3.9 倍的吞吐量提升,同时保持相同的准确率。BBQ 专为速度和效率而设计,可显著降低延迟,使其成为大规模生产工作负载的理想之选。
量化向量重评分现在拥有简化后的 API,进一步提升了开发者的体验。BBQ 使用较小的预测向量执行完整的索引扫描,对结果进行过采样,然后利用更大的向量重新排序。借助新的 API,只需定义过采样率,Elasticsearch 即可无缝处理重排序。
在此版本中,MaxSim 还支持 ColPali 和 ColBERT 等多阶段交互模型!
开箱即用的语义搜索和语义重排序
通过此次发布,开发者可以开箱即用地使用我们的稀疏向量模型 ELSER 和 e5(一款针对语义搜索优化的多语言稠密向量模型)。此外,我们的 Elastic Rerank 模型也支持语义重排序,这对于那些希望在不改变存储数据结构的情况下提升相关性的用户来说,具有独特的优势。
在 Elastic 已有模型的基础上添加您自己选择的模型不应成为难题。借助我们的开放推理 API,您可以轻松使用新增集成的 JinaAI 嵌入和重排序功能,或使用 Watsonx.ai 的语义重排序功能。
例如,语义搜索从单个映射 semantic_text 开始:
PUT my-data
{
"mappings": {
"properties": {
"my_semantic_field": {
"type": "semantic_text" }}}}如果您未指定推理终端,则会使用我们的默认语义模型:ELSER。
如果您想使用 Jina AI 最新的嵌入模型 jina-embeddings-v3,只需指定要与 semantic_text 一起使用的推理终端即可。为了方便起见,如果您想亲自尝试,请参考此 Jupyter 笔记本立即体验!
PUT my-data-with-jina
{ "mappings": {
"properties": {
"my_semantic_field": {
"type": "semantic_text",
"inference_id": "my-jinaai-endpoint" }}}}现在,让我们开始您的第一个自然语言、人类可读的语义搜索。
POST my-data/_search
{ "query": {
"match": {
"my_semantic_field": "Which vector database was the first in the industry to introduce BBQ and contribute it to the open source community?"
}
},
"highlight": {
"fields": {
"my_semantic_field": {
"number_of_fragments": 2,
"order": "score" }}}}或者,如果您更喜欢 ES|QL,请尝试:
POST _query?format=txt
{
"query": """
FROM my-data
| WHERE my_semantic_field:"Which vector database has BBQ?"
| KEEP my_semantic_field
"""
}这些查询的答案当然是:Elasticsearch。您只需定义一个推理终端,即可选择使用我们的默认模型或您喜欢的模型。
等等,还有更多精彩内容!
在此版本中,混合搜索的爱好者会很高兴知道,检索器(我们在之前的版本中添加到查询 DSL 中的开发者抽象层,旨在提升可组合性和易用性)现在能够轻松将线性和通用重评分结合到检索器中,同时配合倒数排序融合 (RRF),这是一种用于在不同搜索类型组合间规范分数的优秀默认技术。
我们持续为 Elasticsearch 查询语言 (ES|QL) 添加令人兴奋的新命令,但有一个新命令在查询 DSL 中尚不可用。让我们携手共进,欢迎利用 Elasticsearch 的强大功能实现跨数据查询的新方式:
// join employees with their department name
FROM employees
| LOOKUP JOIN departments ON dep_id
| KEEP last_name, first_name, dep_name在 ES|QL JOIN 博客中了解更多内容!
立即试用
请参阅发行说明,了解这些功能及更多信息。
Elastic Cloud 的现有客户能够直接从 Elastic Cloud 控制台访问其中的许多功能。没有在云上利用 Elastic?开始免费试用。
想在笔记本电脑上快速启动吗?运行 curl -fsSL https://elastic.co/start-local | sh,几分钟即可开始使用。
您也可以下载 Elastic Stack 以及我们的云编排产品(Elastic Cloud Enterprise 和 Elastic Cloud for Kubernetes),以获得自助管理体验。
本文中描述的任何功能或功能性的发布和时间均由 Elastic 自行决定。当前尚未发布的任何功能或功能性可能无法按时提供或根本无法提供。
在本博文中,我们可能使用或提到了第三方生成式 AI 工具,这些工具由其各自所有者拥有和运营。Elastic 对第三方工具没有任何控制权,对其内容、操作或使用不承担任何责任或义务,对您使用此类工具可能造成的任何损失或损害也不承担任何责任或义务。请谨慎使用 AI 工具处理个人、敏感或机密信息。您提交的任何数据都可能用于 AI 训练或其他目的。Elastic 不保证您所提供信息的安全性或保密性。在使用任何生成式 AI 工具之前,您都应自行熟悉其隐私惯例和使用条款。
Elastic、Elasticsearch、ESRE、Elasticsearch Relevance Engine 及相关标志为 Elasticsearch N.V. 在美国和其他国家/地区的商标、徽标或注册商标。所有其他公司和产品名称均为其相应所有者的商标、徽标或注册商标。