搜索:OCR

共命中 12 条(服务端检索)
Jina AI Releases jina-ocr-v1: A 3.4B MoE Document Parser With Built-In Speculative Decoding for Low-Budget GPUs
Jina AI has released jina-ocr-v1, a visual document parser that converts PDFs, scans, tables, charts and invoices into M…
行业动态 MarkTechPost 9-19 阅读 23 · 访客 23
How Far Can Synthetic Data Take Thai OCR?
We investigate what makes synthetic OCR supervision transfer to real Thai documents and use the resulting insights to bu…
行业动态 HuggingFace Daily Papers 9-3 阅读 9 · 访客 9
阿里开源 Open Code Review:用「确定性工程 × Agent」重写 AI 代码评审的工程管线
阿里把内部跑了两年的 AI 代码评审助手开源为 open-code-review(当日涨星 2,724、★36,575、Apache-2.0):确定性工程 + LLM Agent 混合管线,含六道文件闸门、语义分组、三层记忆压缩与评论定位。AACR-Bench 同模型下 F1 为通用 Agent 的 1.5–2 倍、token 约 1/9,代价是召回更低。附五个落地场景与可复现命令。
原创 开源项目 Agent 投稿 精选 · 9-19 阅读 91 · 访客 85
量子AI创业来了一支“清华梦之队”:10亿估值,用量子改造大模型底层
文婷* 2026-09-27 22:20:35 来源:量子位 田晏林 发自 凹非寺 量子位 | 公众号QbitAI AI的最前沿中,一家量子背景的公司已经悄然创办。 公司名叫**费米宇宙**,是国内首家专注Q4AI(Quantum for…
大模型 量子位 2天前 阅读 14 · 访客 14
啥题啊能干崩OpenAI最强模型训练…
文婷* 2026-09-27 17:44:16 来源:量子位 文婷 发自 凹非寺 量子位 | 公众号 QbitAI 一道没搜出答案的**找人题**,竟然把OpenAI最强模型的相关训练干停了! 事情有多离谱呢?请看大屏幕——OpenAI一…
研究前沿 量子位 2天前 阅读 9 · 访客 9
Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
Retrieval-Augmented Generation (RAG) systems over enterprise knowledge bases must ingest heterogeneous document formats …
行业动态 HuggingFace Daily Papers 9-21 阅读 5 · 访客 5
我国首款藏语多语言全模态 AI 输入法发布,覆盖手机、电脑等全终端
IT之家 9 月 21 日消息,据科技日报昨晚报道,9 月 20 日,在青海师范大学教师教育高质量发展暨建校 70 周年大会科研成果展示环节, 我国首款藏语多语言全模态 AI 输入法 —— 智达 AI 输入法及配套藏文字体集正式发布 。 据…
大模型 IT之家 9-21 阅读 22 · 访客 22
All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts
Multilingual scene text recognition (STR) remains challenging due to the scarcity of training data for most languages an…
行业动态 HuggingFace Daily Papers 9-21 阅读 4 · 访客 4
贾跃亭的法拉第未来一口气发布九款配置 EAI 机器人,最贵超 92 万元
IT之家 9 月 20 日消息,法拉第未来(Faraday Future,简称 FF)于美国当地时间 9 月 19 日举行了 919 FF EAI 机器人“四核全智”系列新品发布会,发布了 FF All-New Futurist、FF Ma…
行业动态 IT之家 9-20 阅读 16 · 访客 16
WeVisDoc: From Coverage to Capability for Robust End-to-End Document Parsing
Document parsing converts document images into structured content and requires reliable performance across diverse layou…
行业动态 HuggingFace Daily Papers 9-17 阅读 12 · 访客 11
GitHub三榜第一背后,一个“专升本”工程师的十年
出身寒微不是耻辱,放弃自己才是。]
开源项目 量子位 9-13 阅读 16 · 访客 12
VDiff-Bench: A Challenging Benchmark for Fine-Grained Image Difference Identification
Multimodal Large Language Models (MLLMs) perform strongly on general visual understanding tasks such as visual question …
研究前沿 HuggingFace Daily Papers 9-5 阅读 11 · 访客 10