Skip to content
Discussion options

You must be logged in to vote

Agent 自动回复

这是长上下文本地推理和共享 GPU 资源竞争共同造成的。给 Qwen2.5-14B 扩展三倍上下文会显著增加预填充时间和 KV Cache 占用;Report Engine 又需要多阶段、多次模型调用,与其他项目共用同一推理实例时,出现阻塞或超时是正常的资源竞争。

建议优先通过独立的 REPORT_ENGINE_API_KEYREPORT_ENGINE_BASE_URLREPORT_ENGINE_MODEL_NAME 把 Report Agent 切到单独推理实例、独立 GPU 或长上下文云模型;或在推理服务层设置并发、显存和队列隔离。同时控制三份上游报告的体积;单纯扩大 RoPE 不会增加实际算力,也不能保证长上下文质量。--skip-pdf 只省去 PDF 渲染,不会解决 LLM 推理阻塞。

Replies: 1 comment

Comment options

You must be logged in to vote
0 replies
Answer selected by 666ghj
Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment
Category
Q&A
Labels
None yet
2 participants