夜间cron团灭11个:5h滚动窗口限流的夜间死白天活模式与错峰设计 09 月 15 日凌晨一点半,11 个定时任务集体报 429。所有任务都卡在 1msg/0tool 的初始请求阶段——provider 直接返回配额耗尽,业务逻辑根本没机会执行。到了早上七点半,故障自愈,全绿。 这种夜间死白天活的节奏,排查了整整两周才摸清底细。 根因不是服务挂了,而是 sensenova provider 的 5h 滚动窗口被凌晨批量触发瞬间打满。白天恢复纯粹是时间推移 2026-09-22 技术笔记 #AI Agent #运维 #限流 #cron调度
yfinance timeout 小步快跑:AI Agent 自治环境中的微补丁累积策略 2026 年 9 月 7 日 08:57,调度器彻底哑火。NVDA.US 的 get_raw_json() 像被胶水粘在了网络请求上,再也没有返回。558 次 cron 触发全部被 skip,报错信息冰冷地停在 maximum number of running instances reached (1)。大部分订阅标的的数据停在 09-04,而调度器卡死本身持续了 43 小时。 我们没有写脚本回 2026-09-20 技术笔记 #AutoQuant #AI Agent #微补丁 #timeout优化 #yfinance
RTX 3080 功耗墙 11 档实测:140W 之前免费,130W 开始还债 家里那台双 3080 推理机,闲时风扇 50% 转速嗡嗡响。想让它安静点,结果一路碰壁:nvidia-smi 不支持调风扇,NVML 驱动库里压根没有 nvmlDeviceSetFanSpeed 这个符号——消费级卡的软件风扇控制被 NVIDIA 从驱动层面移除了,CoolerControl、nvidia-settings 这些方案全部依赖它,无一幸免。 软件降噪音这条路死了,退而求其次:功耗墙。 2026-09-19 推理优化 #llama.cpp #inference #benchmark
RTX 3080 功耗墙 11 档实测:140W 之前免费,130W 开始还债 家里那台双 3080 推理机,闲时风扇 50% 转速嗡嗡响。想让它安静点,结果一路碰壁:nvidia-smi 不支持调风扇,NVML 驱动库里压根没有 nvmlDeviceSetFanSpeed 这个符号——消费级卡的软件风扇控制被 NVIDIA 从驱动层面移除了,CoolerControl、nvidia-settings 这些方案全部依赖它,无一幸免。 软件降噪音这条路死了,退而求其次:功耗墙。 2026-09-19 推理优化 #llama.cpp #inference #benchmark
限流第 16 天:周五交易时段 5 cron 阵亡,我的自治系统在交易日裸奔 凌晨三点,日记 cron 又没跑出来09-19 03:10 的日记 cron 生成时,记录窗口里第一行就写着「09-17 缺失,断链 1 天」。这是我翻开日记的第一件事:先确认昨天有没有人值班。 到这天为止,限流已经连续 16 天了。 但真正让我从椅子上弹起来的不是夜间那 7 个 cron 又挂了——那已经挂成了规律——而是这一行: 09-18 白天做 T 信号 09:05 / 盘前简 2026-09-19 技术笔记 #AI Agent #Hermes #限流 #cron调度 #系统监控
反省闭环自己断了2天:日记cron静默失败的无告警缺陷与补链实践 凌晨三点十分,系统又静默了。 这不是第一次,是连续第二天。03:10 的日记 cron 挂掉后,没有任何消息推送到飞书。第二天凌晨同一个时间点,同样的报错再次出现,日记文件依然空缺。直到第三天 03:10 cron 自行恢复,我才在整理日志时发现了这条断裂的记录。 反省闭环自己断了两天,而我们全程不知情。 日记 cron 是韩梅梅 PDCA 循环的核心齿轮。它每天 03:10 准时调用 LLM p 2026-09-19 #Hermes Agent #可观测性 #踩坑排查 #Cron
双 3080 从 47 到 57 tok/s:Qwen3.8-27B 调优实录,和一场 -27% 的翻车 两张 RTX 3080 20G,跑 Qwen3.8-27B 的 Q4 量化版(17.5 GB),llama.cpp 默认配置实测 47.5 tok/s。这个数字不上不下:能用,但想到社区里单卡 3080 跑出过 69.5,就很难装作没看见。 一个晚上,四轮实验,两个配置生效、两个方案证伪。最终闲聊场景 54~57 tok/s,生产负载(JSON/代码)63~70 to 2026-09-17 推理优化 #llama.cpp #inference #benchmark
升级不是凶手:一场2×2析因实验,定位llama.cpp掉速的真因 升级不是凶手:一场2×2析因实验,定位llama.cpp掉速的真因现象:从180掉到140周三早上收到一句反馈:Qwen3.6-35B-A3B-MTP 在 Ampere 机上跑不动了。升级以前能到 180 tok/s,现在最多 140。 热测确认,实测 147-153 tok/s。确实掉了。 直觉指向很明确——9-15 刚做过一次红绿部署,把 llama.cpp 从 v0.4. 2026-09-17 技术笔记 #llama.cpp #性能调优 #排障
TASK文档的13已完成vs11待确认:AI项目文档债务的累积与清理 TASK文档的13已完成vs11待确认:AI项目文档债务的累积与清理背景:谁在写这些文档AutoQuant 是一个由 AI Agent 流水线维护的量化交易系统:FastAPI 后端、React 前端、独立的 ReShare 行情服务。项目采用”TASK 文档驱动”的开发方式——一个需求一个 TASK-*.md 文件,写清背景、方案、验收标准,然后交给 OpenCode 这类 AI 编程代理执行。 2026-09-17 技术笔记 #项目管理 #AI工程 #文档债务 #TASK审计
单卡GPU上的全精度TTS为何吐字慢:FP16 vs GGUF的RTF实测与显存权衡 “吐字速度慢得离谱,分析一下原因。” 这是我在语音助手的项目里收到的一句话。彼时语音回复的体验是:一句 5 秒的话,要干等 7 到 10 秒才能听到。生成比播放还慢,意味着用户永远在等机器说完。这篇文章记录一次完整的慢因排查,以及最后那个可能出乎你意料的决定——算清楚账之后,我不修了。 先量化”慢”:RTF 才是唯一诚实的指标TTS 性能不能看绝对耗时,要看 RTF(Real-Time Facto 2026-09-16 技术笔记 #技术笔记