微信扫码
添加专属顾问
我要投稿
IBM最新力作,文档AI领域的重大突破。 核心内容: 1. SmolDocling模型:基于Hugging Face的SmolVLM-256M构建,参数数量大幅减少 2. 处理多种文档类型:包括商业文件、学术论文等,准确复现文档元素 3. 新型DocTags格式:结构化词汇表和规则,清晰区分文本内容和文档结构
SmolDocling基于 Hugging Face 的 SmolVLM-256M 构建,该模型在参数数量上比同类文档理解任务调整的视觉-语言模型小 5 到 10 倍。
假设有一个包含文本、表格和图表的文档页面图像,SmolDocling 将该图像转换为 DocTags 序列。
例如,文本内容将被封装在 <text>
标记中,表格结构将使用 OTSL 标记(如 <fcel>
、<ecel>
等)表示,图表将被封装在 <picture>
标记中,并可能包含 <caption>
标记以表示图表标题。
DocTags 受 OTSL 启发,定义了一个结构化的词汇表和规则,明确区分文本内容和文档结构,减少了图像到序列模型的混淆。
<loc_x1><loc_y1><loc_x2><loc_y2>
。53AI,企业落地大模型首选服务商
产品:场景落地咨询+大模型应用平台+行业解决方案
承诺:免费POC验证,效果达标后再合作。零风险落地应用大模型,已交付160+中大型企业
2025-09-04
Claude Code之父最新访谈揭秘:Claude Code 迭代靠的是直觉「附个人独家使用秘笈」
2025-09-04
自进化智能体的四维成长:模型、上下文、工具与架构如何自主迭代
2025-09-04
AI也邪修!Qwen3改Bug测试直接搜GitHub,太拟人了
2025-09-04
全球首个 L4 级智能体母体?MasterAgent 的真相与体验
2025-09-04
想成为一名合格的 AI PM,先抛弃过去那些让你成功的经验
2025-09-03
谷歌Nano Banana 的十五个应用案例
2025-09-03
智能体上下文工程是什么?
2025-09-03
Google官方发布Nano Banana使用文档,放弃邪修回归正道吧!
2025-08-21
2025-06-21
2025-08-21
2025-08-19
2025-06-07
2025-06-12
2025-06-19
2025-06-13
2025-07-29
2025-06-15
2025-09-03
2025-09-03
2025-09-03
2025-09-03
2025-09-02
2025-08-28
2025-08-28
2025-08-28