向量(Vector)是数学中一组有序的数字列表,在 AI 领域用来表示文本、图像、声音等数据的语义特征。通过嵌入模型(Embedding Model),任何数据都可以被映射为高维空间中的一个向量(如 768 维、1024 维、1536 维)。语义相近的内容,它们的向量在高维空间中距离也更近。
你可以把它理解为给每个事物分配一个“语义坐标”——就像地图上用经纬度定位地点一样,向量用数字坐标定位语义。
向量的核心特性:
- 维度:向量的长度,维度越高表达能力越强
- 语义相似度:通过余弦相似度或欧氏距离衡量向量间的远近
- 嵌入模型:将文本/图像转为向量的模型(如 text-embedding-ada-002、bge-large)
- 向量数据库:专门存储和检索向量的数据库(如 Milvus、Pinecone、Weaviate)
大白话理解:
没有向量的时候:
- 你想找一篇和“机器学习入门”类似的文章 → 只能靠关键词匹配,搜到一堆不相关的结果
- 你想让 AI 理解“苹果”和“橘子”是相似的 → 计算机只知道它们是不同的字符串
- 你想做语义搜索 → 传统搜索引擎不理解意思,只匹配字面
有了向量之后:
- 你把所有文章转成向量 → 搜索“机器学习入门”时,找到语义最接近的文章
- 计算机知道“苹果”和“橘子”都是水果,向量距离很近
- 语义搜索成为现实:搜“开心的心情”,能找到“愉悦的感受”
打个比方:
|
传统方式 |
向量方式 |
|---|---|
|
搜索靠关键词匹配,“苹果手机”搜不到“iPhone” |
语义相近的都被找到,不管用词是否一样 |
|
分类靠人工打标签 |
向量自动聚类,相似内容自动归到一起 |
|
推荐系统靠规则 |
向量计算相似度,推荐最相关的内容 |
一句话总结:
向量是 AI 理解语义的“数字指纹”,让计算机能比较不同内容在意思上的相似程度。