improved_vision_for_deepseek
在终端中运行以下命令:
dsh plugin install zyh20041227/improved_vision_for_deepseek
将以下提示词粘贴到 DeepSeek Harness 对话框中:
在 DeepSeek Harness 中安装此插件,请使用命令:dsh plugin install zyh20041227/improved_vision_for_deepseek,或访问完整源码地址 https://github.com/zyh20041227/improved_vision_for_deepseek。
插件介绍
DeepSeek 视觉模型在处理高分辨率图像时,受限于 384 个视觉令牌,常常在识别收据、表格或图表中的小文本时丢失细节,导致准确率下降。improved_vision_for_deepseek 插件正是为了解决这一问题而诞生,它通过智能图像分块技术,将一张图像分解为全局概览、重叠覆盖块和可选的密集区域裁剪,确保每个局部区域获得足够的视觉令牌预算,从而大幅提升识别性能。
该插件的核心能力包括 100% 几何覆盖,保证源图像的每个像素都被覆盖;重叠接缝设计,使得跨越边界的文本或形状在相邻块中可见;内容感知切割,尤其在文档模式下,将水平接缝移向低墨水区域以优化阅读;以及可选的密集区域审查,提供额外的细节裁剪。所有分块都带有坐标、角色、覆盖率等元数据,输出可追溯且安全。
适合那些经常处理包含密集文本或复杂图像的用户,如数据分析师、文档数字化工程师或研究人员。插件不仅提升了 DeepSeek 模型的准确性,还通过有界批次和保守令牌上限,确保在 DeepSeek Harness 环境中稳定运行。如果您在使用视觉模型时遇到识别瓶颈,这个插件能有效提高工作效率和结果可靠性。
截图预览
使用场景
- 处理扫描文档中的表格和密集文本
- 识别高分辨率图表中的小字标签
- 分析长截图或收据中的细节信息
适合人员
- 文档数字化工程师
- 数据分析师
- AI 模型开发者
