> ## Documentation Index
> Fetch the complete documentation index at: https://doc.howen.ink/llms.txt
> Use this file to discover all available pages before exploring further.

# 图片识别

> 上传或粘贴截图，提取其中的日语文字，再进行解析。

图片识别可以从截图、照片或漫画中提取日语文字，并填入输入框。你确认文字无误后，再点击**解析**。

## 提取图片中的文字

<Tabs>
  <Tab title="上传图片">
    1. 点击输入框旁的**上传图片提取文字**按钮。
    2. 选择一张图片文件。
    3. 等待识别完成，提取的文字会填入输入框。
  </Tab>

  <Tab title="粘贴截图">
    1. 截图或复制一张图片。
    2. 在输入框中按 <kbd>Ctrl</kbd> + <kbd>V</kbd>（macOS 为 <kbd>⌘</kbd> + <kbd>V</kbd>）。
    3. 应用检测到图片后会自动开始识别。
  </Tab>
</Tabs>

应用只做文字提取，不翻译或解读图片内容。图片中的换行会被替换为空格，原文顺序保持不变。

识别完成后，页面提示「文字提取成功！请确认后点击"解析"。」检查并修改识别结果，然后点击**解析**。

<Tip>
  开启流式输出时，识别出的文字会逐步显示在输入框中。
</Tip>

## 使用哪个模型

图片识别使用你在**设置**中选择的文本模型：

| 模型服务     | 识别模型                                                         |
| -------- | ------------------------------------------------------------ |
| DeepSeek | `deepseek-flash`                                             |
| Gemini   | 与所选模型版本一致，`gemini-flash-latest` 或 `gemini-flash-lite-latest` |

## 图片处理与限制

* 上传前，应用会在浏览器中压缩图片：长边超过 1600 像素时等比缩小，并以 70% 质量重新编码。
* 压缩后的图片数据不能超过 8 MB。
* 只接受图片文件。选择其他类型的文件时，页面会提示「请上传图片文件！」。

## 识别失败时

| 提示              | 处理                                    |
| --------------- | ------------------------------------- |
| 没有识别到图片中的文字     | 图片中没有可识别的文字，或文字过小。换一张更清晰的图片。          |
| 图片加载失败 / 无法读取文件 | 图片文件损坏或格式不受浏览器支持。换用 PNG 或 JPEG。       |
| 未提供 API 密钥      | 当前服务商没有可用的 Key。在**设置**中填写，或联系管理员。     |
| 图片数据太大，请压缩后重试   | 压缩后的图片仍超过 8 MB。裁剪出含文字的部分，或换一张尺寸更小的图片。 |

<Note>
  图片只在识别时经应用服务端发送给模型服务商，应用不会保存图片。Umami 统计也不会记录图片或提取结果。详见[密钥与隐私](/privacy)。
</Note>
