IN DEVELOPMENTNext Evidence Iteration
让公开站更容易理解,并保持自动化来源生命周期证据准确可审计。
Next Evidence Iteration
让公开站更容易理解,并保持自动化来源生命周期证据准确可审计。
New Capabilities
What Changed
- 直接研究源采集失败时,Actions warning 只陈述本次未采集、生命周期不变与批次继续,不再把实际 quarantined 状态误写成 shadow
- Source Audit 与 Data Refresh 在远端快照 merge 后重新执行来源对账,防止旧生命周期覆盖已满足连续健康门槛的隔离来源恢复结果
- 公开站统一使用领域趋势、事件时间线、来源更新、行动建议、公司与机构、模型价格和信息来源等直白名称
- 首页明确随机展示六个领域中的一个趋势;趋势页把阶段轨迹和阶段证据改为趋势变化轨迹与关键事件和证据
- 查看趋势详情等含糊入口改为查看领域分析、查看相关事件、查看事件时间线等明确目的文案
- 趋势变化轨迹与关键事件改为最新阶段优先,阶段箭头同步反向
- 来源更新新增粗粒度来源类型过滤,移动端地域与来源类型过滤器紧凑并排
- 本地启动、数据库 seed 与默认静态导出自动合并仓库最新快照,避免新 clone 停留在不完整的 seed 数据
- 系统能力评测历史进入版本化快照,CI 以上一提交为基线阻止分数回退,并持续输出按加权缺口排序的真实改进动作
- 事件时间线筛选 tabs 支持桌面鼠标拖拽,取消加载时自动居中,仅在用户点击筛选项后平滑居中
- 公开站新增符合 llms.txt 约定的 AI 可读索引,明确事实、观察与假设边界,并在 Footer 提供可发现入口
- 新增 X 人物时间线观察:只读拉取目录人物的公开发帖,推文内一手链接进入既有发现协议,推文本身只作发现与热度线索
- X 人物时间线改为每天采集一次并在代码层将 twitterapi.io 限制在配置的 QPS 内(免费档 3),把请求排队而非手工 sleep,既守住速率上限又省调用成本
- shadow 观察源不再因偶发失败跌入 degraded 而被永久关掉观察:degraded 只留给 active 源,shadow 源连续失败直接升级为需人工恢复的 quarantined
- 每日 X 刷新自愈:审计恢复健康后,被历史故障降级的时间线自动退回 shadow 并清除陈旧错误,随即重新纳入观察,无需人工逐个开启
- 公开人物页新增「最近观察到」:每位关注对象最多 5 条最新公开发帖,按线索而非证据呈现;「带出一手链接」标记只在推文确实指向一手资料时出现
- 待决策事项集中在一页并分板块:会改写公开判断的事与疑似重复的事件,后者可展开原文再判断
- 需要人拍板的事项进入文件式决策收件箱,并通过 Telegram 卡片推送到手机审批;无人处理 30 天自动归档
- 公开人物页标注每人的覆盖状态与静默天数,且按人分组取样,高产账号不会把安静的人挤出页面——关注是一种覆盖声明,声明必须可检验
- RSS/Atom 采集补齐作者字段,发现漏斗的「作者腿」从此有真实数据:此前只有 GitHub 机器人账号被记录,贡献多数已发布事件的研究论文作者全部丢失
- 社交采集源按策略只能产出发现:acquisition 为 social 的来源永远无法生成事实信号,判定逻辑由采集流水线与 repository 共用
- 只使用无需账号凭据的只读接口,需要提交账号密码与 TOTP 种子的写入类端点永不调用;人物时间线默认关闭,逐人开启
- 公开站与引用元数据的定位表述去掉“中国优先”,与项目使命保持一致
- 人工队列自动封顶:超期未补齐证据的 review 事件与无复现线索软归档,保留溯源可复原
- 信源产出计分卡从溯源链计算命中率、独家证据、领先时间与未使用率,并据此给出晋升与降级候选;样本不足时不给评分
- 新增单机自托管路径:容器化部署、内置阶段隔离调度器与 SQLite 持续复制,公开站静态导出与管理台私有访问保持分离
- 多语言语义比对补齐跨语言重复事件识别:本地嵌入模型提议候选,合并仍走既有人工确认与冲突检查;未配置时回退确定性规则
- AI 收敛 prompt 与校验器共用同一组字段约束,生产实测通过率由 50% 升至 95%;模型撰写的事件默认扣在 review,由人工放行后才进入公开站
- 生产数据库持续复制到对象存储,最坏丢失约 10 秒写入;恢复演练验证 12 张表记录数与生产一致
- eventability 门槛不再让信源权威度替代内容判断:纯版本号与纯维护发布不进入事件队列
- 发现漏斗从既有证据反推未收录的作者与域名,复盘报告把待决策队列、产出计分卡与覆盖缺口合成一份
- 公开人物页展示关注对象与其身份的采集方式
- 已声明的下一信号是否被后续事件兑现成为可度量指标,采用嵌入召回加模型判定;lead time 降级为二手转述源的内部判据
- 事件附带一句角色定向的推荐理由,面向工程师、架构师与 SRE,使不相关的条目可以被直接跳过
- 每周决策摘要只列出一个决定就能推动的事项,缺口来自真实发布门禁而非近似判断,无可决策项时不生成 Issue
- 模型撰写的事件改为过了全部确定性门禁即自动发布:原先扣住它们等人放行,与「未增强事件过不了门禁」互斥,两条路同时堵死使公开站停更 20 天;溯源字段 ai_enriched_at 保留不变
- 合并重复事件不再删除记录:被并入的事件保留溯源并退出时间线,它原来的公开链接改为跳转到保留的那条,因此已发布的事件也可以合并——此前这条限制让重复队列在自动发布开启后完全无法使用
- 重复事件队列新增「忽略」:判定不是同一件事后不再重复提示,但簇里出现新记录时会重新征求判断
- 新增微博观察:按项目自有的查询清单跟踪六家国内实验室的中文讨论,只保留可还原到原帖的引用(含微博官方的大v 标记),模型生成的摘要不入库;结果异步返回,因此微博线索比其它来源慢一轮
- 观察范围扩展到国内实验室的官方 X 账号(DeepSeek、Kimi、Z.ai、MiniMax、Hailuo、StepFun),按组织收录而不混入人物目录,因此公开人物页仍然只列真实的人
- 新增背书索引:记录关注对象在 X 上指向过哪些页面,按有多少个不同的人推荐排序,已经是站内证据的链接会关联到对应事件。范围是任意链接而非只有论文,因为关注对象分享的多数是博客、文档与技术报告
- 关注对象新增 29 位国内前沿实验室的研究员与工程师(DeepSeek、通义千问、Z.ai、月之暗面、MiniMax、字节 Seed、腾讯混元、百度 ERNIE),每个账号都实调接口核过任职;公开人物页改用任职而非地区标注,因为地区字段决定的是采集语言,用英文发帖的北京研究员被标成「全球」是错的
- 公开站新增「我们关注的人在读什么」:被两个以上互不相干的关注对象指向过的页面,页面明说这是推荐阅读而不是结论——不代表重要、不代表是趋势、我们也没有核过
- 模型反复处理失败的事件不再被无限重试:此前同样几条每小时重试一次、直到 45 天后归档,白烧算力也拖着队列不动
- AI 增强一旦停摆会主动推送到 Telegram:它卡在发布必经之路上,停了公开站就不再更新,而此前它是静默跳过的——2026 年 7 月那次停更 20 天,每个环节都在报成功
- 新增「回头看」页:发表满 12–24 个月的论文按被引次数排。它和「他们在读什么」故意分成两页——那边是别人推荐、我们没核过,这边是量出来的结果,混在一起会让前者的免责声明失效
- 「他们在读什么」的推荐理由不再张冠李戴:一条推文若同时指向好几个页面,它说的话无法归给其中任何一个,现在只记是谁转的、不再引用原话
- 「他们在读什么」现在也能显示 YouTube 视频的标题
- 行动建议重做了:不再是六种模板话术轮流套事件标题,而是把同类事件合并成一张有可证伪目标、具体步骤和时间成本的行动卡;生成不出合格的就空着,比凑数强
- 管理台换成了大字版式:正文与表格都为桌面大屏放大一档,来源表把宽度让给名字。登录页与全站一起告别紫色,页脚重排成上下两条清晰的带——上带是本站,底带整行致敬原作
- 站点亮出了自己的身份:首页宣言区说明这个魔改版在证据之上加了「人」的一层,页脚分清了魔改者与被致敬的原作者——上游的星标按钮也搬进了致敬区
- 管理台整体放大了一档字号、放宽了行距——一天看两次的地方不该费眼
- 管理台开始按你的问题组织而不是按数据库的表:来源页默认只列需要注意的,仪表盘能回答昨晚的调度跑干净了吗,危险操作要点两次,判断账本有了任意页面的一键入口
- 管理台会跟你打招呼了:记得你上次来过之后发生了什么,先说需要你拍板的事和它们的过期时间,没有就明说「没有在等你的」——运维工具能说的最温暖的一句话
- 管理台与公开站换上同一张脸:暖炭配陶土、分组导航、破坏性操作红色分级、每个数字都有名字。此前它是另一个世界的蓝黑面板
- 管理台新增判断账本:对推荐阅读里的页面记下「值得」或「不为我」和一句话论点,裁决交给时间——成为站内证据、获得新机构指向、论文被引用都会自动记回,季度简报对照你的押注与世界的走向。账本私有,不进公开站
- 公开站换上自己的视觉:暖纸面配陶土色、衬线大标题,深色主题为暖炭色;不再是又一个蓝黑科技站
- 关注名单里的人在 arXiv 发论文时,控制台会看见:作者名与名单匹配的论文单独成列,带判断按钮——线索不是证据,不影响任何发布权重
- 版本身份统一为 SJCPal Special Edition:顶栏、页脚与三个原创版面(推荐阅读、回头看、关注的人)使用同一套版本标识,页脚致谢区致谢原作者 Barret Lee
- 降级信源现在能自己恢复:连续三次健康检查后自动回到试运行,不再需要人工发现和干预。此前恢复通道只对 X 时间线存在,其它源被一次临时故障降级后标签会永远挂着
- 「他们在读什么」里的论文现在带标题和摘要:取自 arXiv 原文而不是我们改写的,其它站点的链接仍只显示网址——猜测页面标题的下场通常是把对方的 cookie 提示当标题发出去
- 「关注的人」页分成两段:确实在听到的人排在前面并列出最近的帖子,只登记身份、暂时没观察到的排在后面。名单故意全部保留:一份悄悄过期的覆盖声明比一份看得见在过期的更糟
- arXiv 分类源降为冷存:照常入库可查询,但不再成为事件也不再增强。它们此前占掉三分之二的模型调用,却每月只产出一篇合格论文;保留是因为一年期回看需要一个宽池子
- 研究进料改用 HuggingFace 每日论文:每天 50 篇、带社区投票,替代按分类抓取的大杂烩
- 管理台新增背书页:多方指向的页面全部列出且不评分(这种事约每 15 天才有一条,稀有本身就是信号),单点线索按人分组,指向自己或自家域名的不计入而是转成覆盖缺口清单
- 背书新增忽略与回扫:忽略按当时的机构集合记键、不设过期,有新机构指向时自动复现;回扫比较今天与过去某天的机构数,只显示真的涨了的页面
- 新增 HuggingFace 模型发布采集:国内实验室的官网与文档站全是客户端渲染、采集不到,而模型权重落在 HuggingFace,那里的发布带永久链接、时间戳和下载量
- 背书排序改为按不同机构而非不同人:一个链接被同一家实验室的六个人转发是一次发布,被六个互不相干的人转发才是共识
- X 人物观察补上回复、引用转推与翻页:关注对象分享的链接多数在自己主贴的回复里或被引用的推文中,此前完全看不到;现已纳入,且回复只保留带链接的,避免会话内容淹没人物页
- CI 构建、nightly 构建号与预发布标签不再生成事件:一次盲评显示时间线上被判定「不值得看」的条目里大多数是这类构建产物,规则按标签形态识别、不按项目筛选,因此活跃项目的正式发布照常保留
- X 采集成本加固:调度器的时钟改为落库并在重启时恢复,一次部署不再买下一整天的 X 采集;每日刷新以采集运行本身为健康检查,不再先审计再采集;隔离的 X 源不再被每日触碰,充值后用 x:restore 人工放回
- twitterapi.io 日预算与熔断:按 UTC 日计数并落库,任一 401/402 或余额买不起一次调用即当日熔断并推送 Telegram;调度器、API 服务与命令行共用同一账本,被预算拒绝的源不扣健康分
- 所有「跑全部」入口默认不再包含 X 时间线,需显式 --include-x / includeX 才会买;X 采集改为增量,首轮定水位线后只向搜索接口要更新的帖子,静默账号每天只付最低价;回复默认不读,只对把链接放在自己回复里的两位开启
- 新增每日巡检:独立于调度器与 Claude 的系统定时任务每 6 小时只读扫描一遍生产、按 15 项固定规则判断,只在问题首次出现或恢复时推送通知,健康时保持沉默,每周一发一次心跳证明巡检自己仍在运行
- 巡检的判断规则经对抗审查修正三处:X 相关检查只读已有账本与数据库、不再直接调用付费接口;发布量突增改用同一来源近 30 天的单日最高值做基准而不是固定数字;同一环节偶发失败只记进周一心跳,连续两次失败才会立即提醒
- 四个 arXiv 来源改用 RSS 端点:原先的 API 查询对两个大类目会慢走十几秒后拒绝服务,导致来源被误判为故障而隔离;RSS 端点毫秒级返回且内容更全,请求间隔同时放宽到官方要求的 3 秒
- 订阅源取回失败时,记录的错误不再被备用源探测的结果覆盖——报告的始终是配置源自己的首个错误,避免把排查引向错误方向
- 管理台恢复来源时清零陈旧失败计数,避免恢复后一次偶发失败就立刻再次隔离
- 摄入熔断的历史基线剔除已被延期与已被撤回的信号,一次事故不再成为放行下一次事故的尺子;熔断真拦下批次时巡检当天摘要会列出来源与条数并附放行命令
- 新增来源级摄入熔断:单个来源 24 小时内新增信号达到 20 条且超过其自身过去 30 天单日峰值的 2 倍(新源要求已有至少 7 天历史)时,这批信号整体转入待复核而不进入发布链路,人工放行前不会自动恢复;一个 RSS 源两次各返回 50 条从未见过网址、发布日期却被改写成当天的旧闻促成了这条规则——用来源自己的历史做基准,才能既拦住真异常又不误伤本就高产的来源
- 新增批量撤回工具:可按来源与起始时间撤回一批误发事件,默认只打印将要撤回的清单,确认后才真正写库;一批 94 条已发布加 1 条待复核的误发事件已用它撤回
- 修复语义去重连续多日失败:部署脚本会把一个可选依赖装了又卸——生产其实一直需要它,只是每次部署的依赖安装命令都把它清掉,同一个根因反复触发却无人发现,直到日常巡检抓到才被查出;部署脚本已改为保留可选依赖
- 静态导出改为先写临时目录再整体切换:导出中途被中断不再让公开站只剩残缺内容——此前一次被内存限制杀掉的导出把站点留在 7,725 个页面里的 17 个
- 「来源更新」页的数据包从 34,401 条收到最近 5,000 条并为每个信源保底 20 条:传输量降到约四分之一,307 个信源一个不少——只按时间硬切会让其中 166 个从页面上消失,而页头的信源数正是从这份数据算出来的
- 静态导出在切换上线前先自检整站:私有字段泄露、空白栏目、条目数对不上、重复标题、sitemap 与 llms.txt 结构等二十余项,不通过时保留上一版继续服务;此前这套检查只在部署时跑,而站点每小时都在用新数据重建