目录1. 案例目标2. 技术栈与核心依赖3. 项目配置4. 项目结构5. 核心代码实现5.1 图像处理函数调整图像大小图像转 Base645.2 嵌入计算5.3 PDF 处理5.4 搜索功能5.5 答案生成6. 运行与测试6.1 安装依赖6.2 运行应用6.3 使用步骤6.4 测试示例7. 实现思路与扩展建议7.1 核心设计思想7.2 技术亮点7.3 扩展建议7.4 性能优化建议8. 使用场景完整源码vision_rag.pyrequirements.txt本案例将引导您构建一个功能强大的视觉检索增强生成(RAG)系统,利用 Cohere 最先进的 Embed-4 模型进行多模态嵌入,并使用 Google 高效的 Gemini 2.5 Flash 模型回答关于图像和 PDF 页面的问题。1. 案例目标我们将创建一个包含以下核心功能的 Web 应用:多模态搜索:利用 Cohere Embed-4 为给定的文本问题找到最语义相关的图像(或 PDF 页面图像)。视觉问答:使用 Google Gemini 2.5 Flash 分析检索到的图像/页面内容,并生成准确、上下文感知的答案。灵活的内容来源:支持预加载示例图像、上传自定义图像(PNG、JPG、JPEG)以及 PDF 文档自动页面提取。无需 OCR:直接处理 PDF 页面中的复杂图像和视觉元素,无需单独的文本提取步骤。