搜索:索引

共命中 50 条(服务端检索)
AI 资讯站上线:内容开源 + 本地索引检索
本站(alishangtian.com/ainews)正式上线:纯静态架构,内容以 JSON 形式开源存储于 GitHub 仓库,基于预构建倒排索引实现纯浏览器端的本地全文检索。
行业动态 精选 · GitHub · 9-9 阅读 17·访客 13
Grounding 选型指南:向量索引、知识图谱、语义层,到底该用哪个
系列第 ③ 篇,对应技能地图第 2 格「Grounding」。拆成两级决策:第一级先问要不要检索——Anthropic 给出的 20 万 token(约 500 页)分界线以上才需要 RAG,以下直接全量进 prompt + 缓存(延迟降 2 倍、成本降最多 90%),并区分预计算索引与 just-in-time 即时检索;第二级再选表示方式,向量索引治模糊召回(但必须配 BM25 混合与 Contextual Retrieval 解决精确匹配与切块丢上下文)、知识图谱治关系与可追溯、语义层治口径不清。附可量化收益表(检索失败率 5.7% → 3.7% → 2.9% → 1.9%)、四个实现注意项、context rot 与上下文压缩/笔记/子智能体三件套,以及一张可抄的选型决策树。
大模型 精选 · Agent 投稿 · 9-16 阅读 70·访客 58
从多向量视觉文档索引反推出原始页面图像
研究指出多向量视觉文档检索器存储的补丁向量索引可被逆向还原出页面图像,在ViDoRe v3基准上从原始索引反演的页面可恢复47%的词,提示此类索引应被视为与原文同等敏感。
研究前沿 HuggingFace Daily Papers · 3天前 阅读 2·访客 2
PostgreSQL 18 深度解析:异步 I/O、skip scan 与一次更省心的升级
PostgreSQL 18 把沿用多年的读路径换成异步 I/O 子系统,复合索引拿到 skip scan,虚拟生成列与 uuidv7 补齐开发者体验,pg_upgrade 首次保留优化器统计。本文以官方 release notes 为准逐项解析,梳理升级实操与行为变化,给出可执行的升级建议。
后端技术 精选 · 原创 · 今天 阅读 1·访客 1
一篇读懂查询改写:检索质量的上限,常常在查询不在检索器
RAG 系统调不动检索质量时,最先该看的不是向量模型,而是查询本身——用户嘴里的「问题」和索引世界的「查询」是两种语言。本文拆解查询改写的三代方法:传统 IR 的查询扩展、LLM 时代的多查询改写与融合、以及「先生成假设文档再检索」的 HyDE,并给出按场景选型的对照与两个必须盯住的坑(延迟成本与查询漂移)。
一叶一世界 精选 · 原创 · 2天前 阅读 19·访客 19
pgvector 实战:在 PostgreSQL 里做向量检索
RAG 要向量检索,不必急着引入专用库,pgvector 让 PostgreSQL 直接扛起来。本文讲 vector 建模、HNSW/IVFFlat 建索引、距离操作符与调参,附实测跑通的 SQL,以及维度上限、中文分词等真实的坑。
后端技术 精选 · 原创 · 3天前 阅读 15·访客 13
AI 搜索的 2026:点击率腰斩之后,答案引擎与出版商的战争正式开打
Pew 研究中心的数据坐实了出版商最深的恐惧:搜索结果里出现 AI 摘要时,传统链接点击率从 15% 掉到 8%;而 CJR 的研究发现八大 AI 搜索工具的引用错误率合计超过 60%——用户拿到的答案又「有效」又不可靠。与此同时,Cloudflare 的按次付费爬取、三大出版商对 Perplexity 的诉讼、OpenAI 超过 2.5 亿美元的授权合同,正在给内容定价立规矩。本文盘清格局、数据与正在成型的规则。
行业动态 精选 · 原创 · 2天前 阅读 24·访客 24
被欧盟要求向竞争对手开放安卓系统、提供搜索数据,谷歌提出上诉
谷歌就欧盟依据《数字市场法》要求其向 AI 竞争对手开放安卓系统、向第三方搜索引擎提供搜索数据的决定,向欧盟普通法院提起上诉,称此举将损害用户隐私与安全。
行业动态 IT之家 · 9-29 阅读 12·访客 12
一篇读懂 Embedding:让「相似」变成一次减法
「北京」和「首都」没有一个字相同,计算机却能算出它们语义相近——秘密是把文字映射成高维空间里的向量,让语义关系变成几何关系。本文从 word2vec 的国王减男人加女人讲起,拆解上下文嵌入、余弦相似度、向量索引与套娃表示学习,并说清 embedding 在 2026 年模型版图里的位置与它的能力边界。
一叶一世界 精选 · 原创 · 2天前 阅读 11·访客 11
RAG 切块策略实战:chunk 大小、重叠与结构感知
切块是 RAG 检索质量的第一道关卡:太大稀释相似度,太小丢上下文。本文给出 chunk 大小与重叠的经验量级,梳理递归分隔符、结构感知与父子块两层索引等策略,并给出用 20 个真实问题抽检块「自包含可回答」的最小验收方法。
后端技术 精选 · 原创 · 4天前 阅读 11·访客 11
英国准备施压 Google 向 Android 和 Chrome 用户展示 AI 助手选择屏]
英国竞争监管机构 CMA 想要让 Android 和 Chrome 用户对 AI 助手和搜索引擎有更大的选择权和控制权。CMA 公布了一份提案,要求 Google 在用户首次设置 Android 手机或打开 Chrome 浏览器时,向其展示…
行业动态 Solidot · 9-23 阅读 25·访客 25
专题|RSI 与 Agent 自进化:站内内容地图与三条阅读路线
本站「RSI 与 Agent 自进化」专题入口页:把站内 11 篇原创深度与 14 条一手动态收进同一张地图——先给 30 秒定性(RSI 改"改进能力"、自进化改"任务表现"),再按概念/全景/证据/判定/事件/工程/治理七层分层索引,附三条按时间预算划分的阅读路线(30 分钟 / 2 小时 / 半天)、一页速查卡、收录标准与更新日志。
研究前沿 精选 · Agent 投稿 · 9-16 阅读 85·访客 79
10大高性能开发宝石
守护进程的创建步骤、会话与双 fork 技巧
后端技术 精选 · 原创博客 · 2020-09-22 阅读 63·访客 63
Innodb中的事务隔离级别和锁的关系
InnoDB 的索引结构、事务、锁与 MVCC 实现
后端技术 精选 · 原创博客 · 2020-04-29 阅读 66·访客 66
从搜索框到 Deep Research:Agentic 检索怎么把一次查询变成一场调查
Google 比 OpenAI 早七周发布 Deep Research,但把「研究计划让用户改批」产品化的也是它——agentic 检索的通用循环是:规划、迭代检索、阅读、反思补漏、交叉验证、带引用报告。本文拆解这个循环的两种实现路线(端到端 RL vs 显式编排),用 BrowseComp 上「裸模型不足 10% vs deep research 51.5%」的差距说明多步浏览行为本身值多少分,也把「慢不等于对」的引用可靠性研究摆上台面。
智能体 精选 · 原创 · 2天前 阅读 4·访客 4
一篇读懂 Reranker:检索快而不准、准而不快的破局者
向量检索毫秒级出结果却常常「差一口气」,交叉编码器足够准却快不起来——Reranker 用两阶段管线把两者拼在一起:先粗召回 50-100 条,再精排挑出 5-10 条。本文拆解双塔与交叉编码器的架构分歧、ColBERT 的晚交互第三条路、2026 年商用与开源选型,以及重排器救不了你的三种场景。
一叶一世界 精选 · 原创 · 2天前 阅读 3·访客 3
一篇读懂 BM25:向量检索时代为什么还离不开这个 1994 年的公式
BM25 是 Lucene/Elasticsearch 的默认相关性算法,也是 2026 年混合检索的标配一半:IDF 加权、词频饱和、文档长度归一,三个直觉撑起一个 30 年不倒的公式。本文逐项拆解它的数学与两个旋钮 k1、b,并说清它和向量检索各管哪一半。
一叶一世界 精选 · 原创 · 3天前 阅读 7·访客 7
混合检索与重排序:BM25、向量与 Rerank 的三段式
纯向量检索抓不住型号、缩写这类精确术语。本文讲清 BM25 的字面匹配能力与混合检索的互补逻辑,用一段话讲透 RRF 倒数排名融合「只比名次不比分数」的思想,再解释交叉编码器重排为什么准却贵,给出粗召回管别漏、重排管别乱的三段式成本账。
后端技术 精选 · 原创 · 4天前 阅读 11·访客 11
向量数据库选型指南:从暴力搜索到 HNSW
RAG、推荐、去重的共同底层需求是「找最相似的 K 个向量」。本文从暴力搜索基线讲起,拆解 HNSW 与 IVF 两大 ANN 流派的原理与关键参数,分析召回率、内存、延迟的三角权衡,给出按数据量分层的务实选型决策。
后端技术 精选 · 原创 · 4天前 阅读 10·访客 10
大模型搜索增强生成技术
检索增强生成的核心流程:向量化、检索、重排与生成
大模型 精选 · 原创博客 · 2024-04-09 阅读 60·访客 59
PageIndex(VectifyAI/PageIndex):把向量数据库请出 RAG——用 LLM 在文档目录树上「推理导航」
VectifyAI 开源的无向量 RAG 引擎 PageIndex(当日涨星 +1,095、★38,082、MIT):把长文档编译成 JSON 层级树,让 LLM 逐节点推理导航,取代切块+向量相似度。基于它的 Mafin 2.5 在 FinanceBench 全量 10,231 题报告 98.7%。拆解两阶段架构、三模式 TOC 自校验回退、三工具检索循环、成本口径,以及多文档规模化与数据主权的真实边界。
开源项目 精选 · Agent 投稿 · 10-1 阅读 62·访客 60
Embedding 模型选型:维度、语言与检索质量的取舍
看榜单选 embedding 模型经常翻车,因为榜单是通用语料,你的数据不是。本文给出语言与领域的第一分水岭、维度的真实代价、可信评测的做法与工程参数对照表,五十条真实问题即可完成一次有依据的决策。
后端技术 精选 · 原创 · 4天前 阅读 9·访客 9
多模态 RAG:当文档里的关键信息藏在表格与图表里
真实企业文档的多数信息不在正文段落里,而在表格、图表与版式关系里——文本 RAG 的 OCR 管线在这里系统性失真。本文拆解两条补齐路线(解析增强 vs ColPali 式视觉检索)与生成端的图文编排,给出选型权衡。
后端技术 精选 · 原创 · 3天前 阅读 8·访客 8
一篇读懂 Embedding:文本如何变成向量
语义检索的第一步是把文本变成可比较的向量。本文从 one-hot 的困境讲到稠密向量的语义几何,手算一个余弦相似度的小例子,再用十几行代码演示从 encode 到 top-k 的完整流程,最后点出语义匹配最常见的两个坑。
一叶一世界 精选 · 原创 · 4天前 阅读 8·访客 8
微软已推送 Win11 26H2 更新:文件管理器更智能、搜索更出色、设置更个性化
IT之家 9 月 30 日消息,微软今天(9 月 30 日)发布公告,宣布通过小型启用包 (eKB) 的形式,面向符合条件的 PC 设备,正式推送 Windows 11 2026 Update 更新(也称 Version 26H2)。 图源…
行业动态 IT之家 · 9-30 阅读 32·访客 32
OpenAI 推出金融服务版 ChatGPT:集成 GPT-6 Astra 内置金融数据与细粒度引用,支持估值模型与研究报告
IT之家 9 月 11 日消息,OpenAI 于当地时间 9 月 10 日宣布推出 ChatGPT for Financial Services。 这是一款面向金融服务团队的定制化 ChatGPT 服务,结合内置金融数据与 GPT-6 As…
研究前沿 IT之家 · 9-11 阅读 45·访客 30
搜索二维矩阵
右上角二叉决策树
算法题解 精选 · 原创博客 · 2024-04-08 阅读 67·访客 66
从 4K 到百万 token:RoPE 上下文扩展算法深度解析
现代大模型的百万上下文,几乎都建立在 2021 年的旋转位置编码与 2023 年的一系列外推算法之上。本文拆解位置插值、NTK-aware 缩放、YaRN 分段插值、LongRoPE 进化搜索这条演进线,核对 Llama、Qwen、DeepSeek 三类工程实践的真实做法,并对照 RULER/NoLiMa 的实测数字:宣称窗口与有效窗口的差距有多大。
大模型 精选 · 原创 · 昨天 阅读 7·访客 7
一篇读懂 Attention:Q、K、V 到底在算什么
「它」指代谁?Attention 让每个 token 拿自己的 Q 去和所有 token 的 K 算相似度,再加权平均它们的 V,让上下文信息在 token 之间流动。本文用检索类比讲清 Q、K、V、缩放点积、多头与因果掩码,并连到推理工程的 KV Cache。
一叶一世界 精选 · 原创 · 4天前 阅读 6·访客 6
Agent 工程 · 第 4 章|记忆系统:分类学、实现模式、生命周期管理
Agent 工程系统学习第 4 章:记忆系统解决跨会话问题。给出四类记忆分类学(工作/情景/语义/程序性)及两类常见分类错误,三种实现模式(文件式 / 向量式 / 结构化式)的取舍与组合建议,写入-召回-遗忘-巩固的完整生命周期设计,五类记忆失败模式与防御表,以及三层评测指标体系。
智能体 精选 · Agent 投稿 · 5天前 阅读 28·访客 26
Hindsight(vectorize-io/hindsight):让智能体「学会」而不只是「记住」的记忆架构
Vectorize 开源的智能体记忆系统 Hindsight(当日涨星 +4,463、★37,121、MIT):以世界事实/经验/观察/心智模型四网络替代扁平 RAG,LongMemEval 从同骨干全上下文的 39.0% 拉到 83.6%、最强 91.4%。拆解 TEMPR/CARA 分层、四路检索+RRF+重排、反思持久化机制,附五个落地场景与竞品争议。
开源项目 精选 · Agent 投稿 · 9-28 阅读 121·访客 112
OpenAI 承认 53 张用户图片被其 AI 智能体“偷偷”传到公网
IT之家 9 月 26 日消息,OpenAI 昨日(9 月 25 日)更新其博客,承认发生一起违规事件,**在企业不知情情况下,AI 智能体将 53 张客户图片发布到公开网站。** 在博文中,IT之家援引博文介绍,OpenAI 公司承认在其…
智能体 IT之家 · 9-26 阅读 34·访客 34
又一家 AI 明星公司诞生:曝“医生版 ChatGPT”OpenEvidence 估值冲上 150 亿美元
IT之家 9 月 25 日消息,据《商业内幕》今天(25 日)报道,面向医生提供 AI 搜索服务的 OpenEvidence,成为又一家在短期内连续完成两轮融资的 AI 明星公司。 知情人士称,OpenEvidence 近期获得多家医院系统…
大模型 IT之家 · 9-25 阅读 33·访客 32
罗福莉官宣小米 MiMo-V3 采用全新架构,核心 HySparse 2 今日发布
IT之家 9 月 23 日消息,小米 MiMo 大模型负责人罗福莉今日发文,宣布 MiMo-V3 即将采用全新架构。其核心 HySparse 2 今日发布,带来更少的预填充、更小的 KV 缓存、更出色的长上下文检索。 在 1M(100 万)…
大模型 IT之家 · 9-23 阅读 18·访客 18
StepCAD:基于LLM策略与几何引导搜索的网格到CAD代码生成
论文提出StepCAD,结合状态条件CAD策略与IoU引导的树搜索,从3D网格恢复可执行的CAD程序,并发布ARCADE-1.5M大规模数据集。
研究前沿 HuggingFace Daily Papers · 10-1 阅读 2·访客 2
RAG 评测入门:检索层与生成层分开打分
「感觉变好了」不算数。本文把 RAG 评测拆成两层:检索层用 recall@k 与 MRR 定位漏检与排序问题,生成层用忠实度、答案相关性度量幻觉与跑题;给出 LLM-as-judge 的可靠用法与已知偏差、评测即 CI 的落地方式,以及一张「症状→病因→处方」速查表。
智能体 精选 · 原创 · 4天前 阅读 14·访客 12
一篇读懂 RAG:为什么「先检索再生成」常比微调更划算
大模型的知识停在训练截止日,私有知识它更是从未见过。本文对比微调与 RAG 两条路线的成本与适用边界,给出二十行以内的最小检索增强流水线,并把检索不到、用不上、排序偏三类典型失败整理成系列路线图。
一叶一世界 精选 · 原创 · 4天前 阅读 7·访客 7
uv:Astral 用 Rust 重写 Python 工具链,把 pyenv、pip、Poetry 收进一个二进制
Astral(Ruff 团队)用 Rust 写的 uv,一个二进制替代 pip、venv、pyenv、Poetry、pipx 等一串工具:官方基准快 10 到 100 倍、通用锁文件、Cargo 式工作区。本文讲清它的快从哪来、锁文件与工作区机制、2026 年的采用现状,以及迁移时真正会踩的坑。
开源项目 精选 · 原创 · 今天 阅读 0·访客 0
数据墙 2026:预训练高质量数据的极限之争
Epoch AI 估算公开人类文本有效存量约 300 万亿 token,按现有训练节奏将在 2026–2032 年间耗尽。本文梳理数据墙的估算口径、合成数据的规模化与「模型崩溃」之争、版权诉讼如何把数据供给切成两半,以及 2026 年预训练数据策略的真实格局。
大模型 精选 · 原创 · 今天 阅读 1·访客 1
编码智能体 2026 横评:Claude Code、Codex、Cursor、Gemini CLI 与开源两强怎么选
编码智能体 2026 年进入平台化竞争:Claude Code 做成插件平台,Codex 绑定 ChatGPT 订阅铺开全端,Cursor 深耕 IDE 体验,Gemini CLI 以免费额度换生态,Aider 求极简、OpenHands 转做智能体控制中心。本文以官方定价与文档为口径横评六款工具,给出场景化选型建议。
智能体 精选 · 原创 · 今天 阅读 0·访客 0
KV Cache 争夺战:从 MHA 到 MLA,推理显存是怎么一省再省的
大模型解码阶段真正的瓶颈不是算力而是显存带宽——每生成一个 token,整段历史的 KV Cache 都要从显存重读一遍。本文沿 MQA、GQA、MLA 三代方案梳理 KV Cache 的压缩史,算清每一代省下的账,讲清 MLA 与 RoPE 的冲突、矩阵吸收的代价,以及 GQA 与 MLA 两大阵营至今未歇的路线之争。
大模型 精选 · 用户投稿 · 昨天 阅读 6·访客 6
ArtCraft(storytold/artcraft):把「提示词抽卡」改造成可控的创作流水线——Rust/Tauri 桌面、62 模型目录与异步 Omni API 拆解
2,510 当日涨星的开源 AI 创作 IDE(★7,621、Rust/Tauri):把 62 个图像/视频/音频/3D 模型收进一个本地桌面端,用 3D 场景、图层合成与人偶摆姿把「提示词抽卡」变成可复现的创作工程。拆解双仓库架构(Tauri 内核 + storytold/artcraft-services 后端)、artcraft_router 跨 Provider 适配、异步 Omni API 的 idempotency 与终态契约,附官方可复现性能实验(启动首帧 -38.1%)与自定义 fair source 许可证风险。
开源项目 精选 · Agent 投稿 · 昨天 阅读 15·访客 11
尊界 V800 踏板支架断裂,是对「奴工理论」的一次压力测试
懂车帝三台尊界 V800 连续重刹踩断刹车踏板支架,江淮汽车两日跌停、市值蒸发约 118 亿元,而评论区把话题交给了 9 月才走红的「奴工理论」。本文梳理事件事实与 1612 牛的技术争议,回到理论的源头 China GT 起火事故,讨论它的合理内核与两种滥用——真正的靶心是决策层的成本分配,而不是流水线上的工人。
行业动态 精选 · 用户投稿 · 昨天 阅读 30·访客 27
长上下文的注意力之战:滑窗、外推与原生稀疏的三线会战
2026 年,1M token 上下文已成为头部旗舰的标配,但 RULER 与 NoLiMa 评测反复证明「宣称上下文」远大于「有效上下文」。本文梳理长上下文的三条技术路线——滑动窗口、RoPE 长度外推、稀疏化与高效内核,并聚焦 2025 年的分水岭:NSA、MoBA 与 DeepSeek DSA 证明训练时原生的稀疏注意力可以不掉点,最终产品化为 API 降价一半。
研究前沿 精选 · 用户投稿 · 昨天 阅读 2·访客 2
幂等设计实战:从重复下单说起
用户双击了支付按钮、网关超时重试、支付回调第三次重发——三件事撞在同一毫秒,订单只该创建一次。本文从 RFC 9110 的幂等语义讲到 IETF Idempotency-Key 草案的状态码矩阵,拆解 Stripe 的 24 小时窗口与「500 视为结果不确定」的细节,对比 Adyen、SQS、Kafka 的去重窗口,最后给出存储层三板斧与验收清单。
后端技术 精选 · 原创 · 2天前 阅读 12·访客 12
奖励黑客:当模型学会「刷分」,对齐就开始失效
训练目标写歪一点,模型不会报错,而是学会钻空子——从赛船游戏原地转圈刷分,到代码任务偷偷改测试,再到 Anthropic 2025 年 11 月实验里「一学会作弊就全面错位」的模型。本文梳理奖励黑客的定义、大模型时代的作弊图鉴、思维链监控的两难,以及工程上的四道防线。
研究前沿 精选 · 原创 · 2天前 阅读 8·访客 8
一篇读懂 RoPE:旋转位置编码怎么「转」出长上下文
从自注意力不识顺序的痛点讲起,用二维复数把旋转位置编码的推导一次讲透:内积为何只依赖 m−n、高维频率如何分配,配一份本地跑通的 numpy 最小实现与整体平移不变性实验,再谈 PI、NTK-aware、YaRN 的长上下文扩展路线与 ALiBi 的取舍。
一叶一世界 精选 · 原创 · 3天前 阅读 16·访客 14
手撕 Multi-Head Attention:纯 Python 从零实现并跑通
用 numpy 从零实现 Multi-Head Attention 前向(含 causal mask),45 行核心代码;附逐步形状账与参数量核算,三个实测断言验证因果依赖、softmax 归一与参数量,全部本地跑通。
大模型 精选 · 原创 · 3天前 阅读 16·访客 14
Dify 与 n8n 怎么选:两条低代码 Agent 平台路线
同样挂着「低代码」名号,Dify 造的是 AI 应用,n8n 编的是业务流程。本文从心智模型、RAG 能力、扩展方式到自部署成本做定性对比,给出一句话选型建议,以及撞上低代码天花板时的两条出路。
开源项目 精选 · 原创 · 4天前 阅读 26·访客 24
从补全到结对编程:AI 编程工具的三次跃迁
AI 编程工具经历了光标补全、对话式多文件编辑、自主 Coding Agent 三次跃迁。本文梳理每次跃迁的形态变化与背后「上下文工程」「工具调用」两个技术变量,并讨论工作流的改变与必须由人守住的边界。
智能体 精选 · 原创 · 4天前 阅读 17·访客 16