Your current location:Home > 古剑奇谭 text

第九区

竞争特斯拉Model Y Performance!凯迪拉克Optiq-V官图正式发布_我的网站

锵锵三人行

一 |     就在刚刚,DeepSeek开源了一个3B模型DeepSeek-OCR。

二 | 虽然体量不大,但模型思路创新的力度着实不小。    

[ 新车官图] 近日,凯迪拉克官方正式发布了Optiq-V车型的官图。

三 | 新车作为Optiq(国内IQ傲歌)的高性能版本,将会配备526马力的大功率电机,同时提供85kWh的电池组,0-96km/h加速时间仅为3.5秒,续航里程可达443公里。据悉,新车海外售价68795美元(约合人民币49.48万元),计划于今年秋季投产,前期率先供应美国、加拿大、墨西哥、中东和以色列市场。

外观设计上,Optiq-V保留了Optiq的基础设计元素,在此基础上增加了许多运动化的设计细节。                   众所周知,当前所有LLM处理长文本时都面临一个绕不开的困境:计算复杂度是平方级增长的。例如,新车车头部分采用了独有的V系列格栅和前包围,其中包括新的中网设计、下部格栅中标志性的V图案网眼、高光黑色的前唇下部装饰。序列越长,算力烧得越狠。

四 |                              于是,DeepSeek团队想到了一个好办法。同时新车还提供碳纤维包装,包含碳纤维前唇、后扩散器和后扰流板。同时,新车还将配备21英寸的轮圈,并在轮圈条幅上激光蚀刻V系列徽章标识。既然一张图能包含大量文字信息,而且用的Token还少,那不如直接把文本转成图像?这就是所谓的“光学压缩”——用视觉模态来给文本信息“瘦身”。

五 |

车尾部,整车的设计依旧可以看出凯迪拉克的标志性的“钻石切割”设计手法,作为V系列版本,熏黑的后尾灯外壳必不可少,同时搭配车顶扰流板以及上文提到的碳纤维后备厢扰流板和碳纤维尾部扩散器装置,整体搭配让新车具有非常不错的运动化属性。

六 | 此外,新车还将提供两种限量版外观颜色,一种是“Magnus Metal Frost”-哑光金属灰色,另一种则是图中的Deep Ocean Tintcoat深海蓝色车漆。

车辆内部的设计上,同样遵循了V系列的运动感与凯迪拉克的豪华气息。

七 | 新车配备33英寸的一体式超长“带鱼屏”,并可做到分屏显示信息。                   而OCR正好天然适合验证这个思路,因为它本身就是在做“视觉→文本”的转换,而且效果还能量化评估。                             论文显示,DeepSeek-OCR的压缩率能达到10倍,OCR准确率还能保持在97%以上。

八 |                    啥意思呢?就是说,原本需要1000个文本Token才能表达的内容,现在只用100个视觉Token就搞定了。Optiq-V还采用了由100%回收材料制成的纱线编织而形成的深色图案装饰面料,而内部门板采用圣托里尼蓝色装饰缝线装饰;座椅靠背具有独特的V系列峡湾穿孔图案,座椅上绣有蓝色V系列徽章。

配置上,Optiq-V提供两种内饰颜色选择,一种为带有圣托里尼蓝色+黑色点缀的搭配,另一种则是带有圣托里尼蓝色+酷灰色的搭配。另外,座椅靠背与安全带均可以选择圣托里尼蓝色。即使压缩率拉到20倍,准确率也还有60%左右,整体效果相当能打。

九 | 新车还配备19扬声器AKG音响系统,搭配杜比全景声;新车标配超级巡航驾驶员辅助技术,包括自适应巡航控制、盲区转向辅助、增强自动停车、前方碰撞警报等。                   OmniDocBench基准测试结果显示:                    只用100个视觉Token,就超过了GOT-OCR2.0(每页256个Token)的表现;          用不到800个视觉Token,干翻了MinerU2.0(平均每页超过6000个Token)。                        在实际生产中,一块A100-40G显卡就能每天生成超过20万页的LLM/VLM训练数据。20个节点(160块A100)直接飙到每天3300万页。                             DeepSeek-OCR由两个核心组件组成:                    DeepEncoder(编码器):负责图像特征提取和压缩;          DeepSeek3B-MoE(解码器):负责从压缩后的视觉Token中重建文本。                        让我们来重点说说DeepEncoder这个引擎。

动力方面,新车将配备前后双电机四驱系统,综合功率526马力,最大扭矩880牛·米,0-96km/h加速时间仅为3.5秒。新车还配备了85kWh的电池组,WLTC工况下续航里程为443公里;Optiq-V还是通用汽车旗下第一款采用原生NACS(北美充电标准)充电口的车辆。                   它的架构很巧妙,通过把SAM-base(8000万参数)和CLIP-large(3亿参数)串联起来,前者负责“窗口注意力”提取视觉特征,后者负责“全局注意力”理解整体信息。(文/ 毕业)
。                   中间还加了个16×卷积压缩器,在进入全局注意力层之前把Token数量大幅砍掉。

十 |                    举例而言,一张1024×1024的图像,会被切成4096个patch token。但经过压缩器处理后,进入全局注意力层的Token数量会大幅减少。                   这样的好处是,既保证了处理高分辨率输入的能力,又控制住了激活内存的开销。                   而且DeepEncoder还支持多分辨率输入,从512×512的Tiny模式(64个Token)到1280×1280的Large模式(400个Token),一个模型全搞定。                   目前开源版本支持的模式包括原生分辨率的Tiny、Small、Base、Large四档,还有动态分辨率的Gundam模式,灵活性拉满。                             解码器用的是DeepSeek-3B-MoE架构。                   别看只有3B参数,但采用了MoE(混合专家)设计——64个专家中激活6个,再加2个共享专家,实际激活参数约5.7亿。这也让模型既有30亿参数模型的表达能力,又保持了5亿参数模型的推理效率。                   解码器的任务就是从压缩后的视觉Token中重建出原始文本,这个过程可以通过OCR风格的训练被紧凑型语言模型有效学习。                   数据方面,DeepSeek团队也是下了血本。                   从互联网收集了3000万页多语言PDF数据,涵盖约100种语言,其中中英文占2500万页。                   数据分两类:粗标注直接用fitz从PDF提取,主要训练少数语言的识别能力;精标注用PP-DocLayout、MinerU、GOT-OCR2.0等模型生成,包含检测与识别交织的高质量数据。                   对于少数语言,团队还搞了个“模型飞轮”机制——先用有跨语言泛化能力的版面分析模型做检测,再用fitz生成的数据训练GOT-OCR2.0,然后用训练好的模型反过来标注更多数据,循环往复最终生成了60万条样本。

十一 |                    此外还有300万条Word文档数据,主要提升公式识别和HTML表格解析能力。                   场景OCR方面,从LAION和Wukong数据集收集图像,用PaddleOCR标注,中英文各1000万条样本。                             DeepSeek-OCR不仅能识别文字,还具备“深度解析”能力,只需一个统一的提示词,就能对各种复杂图像进行结构化提取:                    图表:金融研究报告中的图表可以直接提取为结构化数据;          化学结构式:识别并转换为SMILES格式;          几何图形:对平面几何图形进行复制和结构化解析;          自然图像:生成密集描述(dense captions)。                        这在STEM领域的应用潜力巨大,尤其是化学、物理、数学等需要处理大量符号和图形的场景。                   第一作者Haoran Wei此前曾供职于阶跃星辰,期间发布并开源了GOT-OCR2.0系统                    值得注意的是,DeepSeek团队在论文里还提出了一个脑洞大开的想法——用光学压缩模拟人类的遗忘机制。                   人类的记忆会随时间衰退,越久远的事情记得越模糊。DeepSeek团队想,那能不能让AI也这样?于是,他们的方案是:                    1. 把超过第k轮的历史对话内容渲染成图像;          2. 初步压缩,实现约10倍的Token减少;          3. 对于更久远的上下文,继续缩小图像尺寸;          4. 随着图像越来越小,内容也越来越模糊,最终达到“文本遗忘”的效果。                   这就很像人类记忆的衰退曲线,近期信息保持高保真度,久远记忆自然淡化。                   虽然这还是个早期研究方向,但如果真能实现,对于处理超长上下文将是个巨大突破——近期上下文保持高分辨率,历史上下文占用更少计算资源,理论上可以支撑“无限上下文”。                             简言之,DeepSeek-OCR表面上是个OCR模型,但实际上是在探索一个更宏大的命题:能否用视觉模态作为LLM文本信息处理的高效压缩媒介?                    初步答案是肯定的,7—20倍的Token压缩能力已经展现出来了。                   当然,团队也承认这只是个开始。单纯的OCR还不足以完全验证“上下文光学压缩”,后续还计划开展数字–光学文本交替预训练、“大海捞针”式测试,以及其他系统性评估。                   不过不管怎么说,这在VLM和LLM的进化路上,又多了一条新赛道。                   去年这个时候,大家还在卷怎么让模型“记得更多”。今年DeepSeek直接反其道行之,不如让模型学会“忘掉一些”。                   确然,AI的进化,有时候不是做加法,而是做减法。

十二 | 小而美,也能玩出大花样,DeepSeek-OCR这个3B小模型就是最好的证明。                   GitHub主页:http://github.com/deepseek-ai/DeepSeek-OCR          论文地址:https://github.com/deepseek-ai/DeepSeek-OCR/blob/main/DeepSeek\_OCR\_paper.pdf          模型下载:https://huggingface.co/deepseek-ai/DeepSeek-OCR                    本文来自微信公众号:APPSO (ID:appsolution)。

十三 |

Current article:http://ib1j.bainangmieruopanglaomen.sbs/list_ky9v0/73iwksk.html

Published on:21:10:36


 Live broadcast Hall
·全国56家影院29日直播樊振东德国杯比赛,多地门票已售罄,影院员工:3分钟卖光,我们也很震惊
·耐心资本浇灌、保险精准护航 中国人寿奋力书写“科技金融”新篇,耐心资本浇灌、保险精准护航 中国人寿奋力书写“科技金融”新篇
·三星S10支持超声波屏幕外指纹,但不能粘贴胶片
·Depp Set to Return to Pirates of the Caribbean After Defamation Trial Win Against Heard - Report
·疫情通报:过去一周新西兰新增6312例
 Press release
·天文学专业走热带来的启示
·队记:国王揭幕战客战快船 主场对勇士
·京东双十一什么时候开始 从10月9日开始持续到11月14日结束 2025京东双十一最强玩法清单
·斯特鲁斯飞抵洛城难掩兴奋 期待开启快船新征程
·Stellantis to build 2nd EV battery factory in Kokomo, Indiana
 Collection of municipal and local releases
·极氪发布最新概念车0.01:6岁孩童操刀设计
·更强大!谷歌FI运营商服务推出下一代短消息功能rcs
·江苏常州通报:星宇股份已对人力资源总监作停职处理,不存在违规享受就业和人才类政府补贴行为
·河北辛集:文明七夕树新风 公益红娘助良缘
·Dehradun News: खेल महाकुंभ में सीएम, सांसद व विधायक के नाम पर होंगी ट्रॉफी, विजेताओं को मिलेगा ये इनाम

 

Copyright © 2020-2099 第九区 All Rights Reserved 第九区 Copyright