https://github.com/deepseek-ai/DeepSeek-OCR
https://www.ithome.com/0/890/839.htm
10 月 20 日消息,今天上午,DeepSeek-AI 团队发布《DeepSeek-OCR:Contexts Optical Compression》论文,提出利用视觉模态压缩长文本上下文的新方法。Hugging Face 页面显示,该模型的参数量为 3B。
实验显示,当文本 token 数量不超过视觉 token 的 10 倍(压缩比低于 10×)时,模型的 OCR 精度可达 97%;即便压缩比提高到 20×,准确率仍保持约 60%,展现出在历史文档长上下文压缩和大语言模型记忆机制研究中的巨大潜力。DeepSeek-OCR 同时具备较高的实际应用价值。
我去实际看了一下原理。目前多模态的原理是文本编码器和视觉编码器都会编码产生token输出给LLM。他这个算法是,输入1000个文本token 转换成 100个视觉token,然后只要处理100个token就可以了,解码精度仍然有97%
感觉很有潜力
坏就坏在不会用,大模型好坏全看排行榜
感谢分享
这是个工具型的,不错啊
升级速度越来越快了,期待下测评
期待下
等一下评测
这个好
好好好
纯ocr?