AI · JAVA · CONTAINERS

在工程现场打磨智能与基础设施

这里记录把大语言模型塞进 Java 服务、用容器把一切标准化、以及在 Kubernetes 上让它们稳定奔跑的真实经验。

大模型推理 JVM 调优 云原生 Spring AI eBPF 观测

最新文章

按主题筛选 · 持续更新
Java

虚拟线程的五个隐藏陷阱

Project Loom 让并发变简单,但 synchronized、native 栈与线程局部变量依然会在高并发下反咬一口。

2026-07-09· 9 min
AI

用 Java 写一个 LLM 网关

限流、重试、fallback 与多模型路由——把不稳定又昂贵的大模型调用抽象成内部稳定接口。

2026-06-28· 14 min
容器

用 eBPF 透视 JVM 的网络行为

不修改一行代码,借助 eBPF 在内核态捕获 Java 服务的连接、延迟与重传,定位偶发超时。

2026-06-20· 11 min
Java

GraalVM Native Image 实战踩坑

把 Spring Boot 编译成原生二进制,启动从 4s 到 80ms,但反射、动态代理与资源加载需要重新认识。

2026-06-12· 10 min

把 AI 推理塞进容器

一个典型的部署:Spring Boot 通过 spring-ai 调用本地推理服务,推理服务跑在独立容器中,由 Kubernetes 根据 GPU 利用率做弹性伸缩。下面是一段最小化的部署片段。

关键不在写得多花哨,而在资源边界、优雅停机与可观测性都对齐。

# deployment.yaml (节选) resources: limits: nvidia.com/gpu: 1 memory: 4Gi readinessProbe: tcpSocket: { port: 8080 } initialDelaySeconds: 15 lifecycle: preStop: exec: command: ["/bin/sh","-c","sleep 10"]