本期编译精选。
试图将PDF,幻灯片和扫描文件输入AI管道的企业不断跑入同一墙:这些工具要么错过了结构——表格,图表,布局,要么成本过高,无法大规模运行. Cohere在星期四发布了第5集,将其定位在价格对业绩而不是原始准确性上——企业规模的正确成本能力组合. 第5集是一个23亿参数的视觉语言模型,用于在企业规模中将PDF,幻灯片和图像转换为结构化的Markdown. Cohere自己的已公布的基准比较使得Parse 5在精确度上落后于三个更大的通用前沿模型. GPT-5.5、Opus 4.8和双子座3.5 在三个Parse Bench维度 Cohere报告上闪出所有比Parse更高的分数. 科赫尔不声称得分最高。它声称得分接近最高点的最好价格。公司通过API以每千页1.50美元的价格定价该型号,有Model Vault,Cohere安全,单租机平台用于管理推论,可供高容量部署. 文档解析没有解决,因为困难的部分不是读出文本,而是保留了结构和意义,Nils Reimers, AI Search at Cohere的VP告诉VentureBeat. 企业文档混合了表格,图表,图表,以及格式,改变了数据的解释. 大多数工具仍会降低结构或幻觉内容, 在单通架构 第5版中,将一页作为图像,通过单一的视觉语言模型通过运行,并返回结构化的Markdown,崩溃了大部分作为单独步骤运行的OCR-plus模型管道. 建筑学. 它是一个23亿参数的视觉语言模型,由Cohere Labs的北-米克罗-Vision-Instruct架构所建,有8,192个上下文窗口和大约4.6个基加比特脚印. 它接受一个 PDF, PowerPoint 或 JPEG 页面作为基数64- 编码的图像, 并按读取顺序返回 Markdown , 表格作为 HTML, 图像提供。
(编译自 VentureBeat;原文
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论