Product concept / 2026

把私有算力
放进一个盒子

一台可以长期在线、完全离线可用、能被电脑和手机随时调用的个人 AI 算力盒子。用户不需要研究模型,只需要提出问题、选择能力,并得到稳定快速的结果。

目标:30+ tokens/s上下文:65k–100k预算:≤ ¥5,000默认:单请求串行
01

产品定义

参考上海交大 Tiiny Pocket AI 的双芯片思路,但把产品重点从“能运行大模型”推进到“普通人能持续使用的本地 AI 设备”。

核心价值

不折腾模型

盒子自动选择合适的非 thinking 模型和运行策略,用户主要关注响应速度与回答质量,而不是当前到底加载了哪个模型。

使用原则

默认私有,按需联网

关掉光猫后,盒子仍可在局域网内工作;只有用户主动开启网络访问能力时,系统才通过受控通道访问外部信息。

产品边界

一台设备服务一个请求

受内存和 KV Cache 限制,第一版明确采用单个大上下文、单请求串行处理,优先保证稳定性与速度。

02

目标指标

30+tokens/s

目标输出速度。1000 token 输出约 33 秒。

65k–100k上下文

覆盖长文档、代码和 Codex 类工具的基本需求。

24h低功耗在线

空载低电耗,可作为家庭长期运行的基础设施。

硬件假设
  • 双芯片架构:SoC 内存约 20G,NPU 内存 16G 及以上。
  • 主力模型:8B 级非 thinking 模型,例如 Qwen3-8B,模型内存约 4G。
  • KV Cache 预留约 7–12G,用于 65k–100k 上下文。
成本与形态
  • 整机尺寸不超过传统家庭 NAS。
  • 目标售价不超过 ¥5,000,不高于 Mac mini 的心理价位。
  • 功耗目标低于竞品参考值;竞品 Tiiny Pocket AI 约为 65W。
03

盒子、电脑与手机如何连接

两种模式覆盖“随身使用”和“远程调用”:USB-C 是默认的低门槛直连方式,网络模式则通过设备密钥建立授权访问。

电脑 / HiAppAgent 商城 · 本地盘映射 算力盒子LLM · 网关 · Agent 运行时 手机App / 小程序外出提问 USB-C 直连默认模式 · 即插即用 授权网络访问设备密钥 · 加密通道 电脑可调用盒子 LLM API;局域网断外网仍可用 盒子产生并管理访问密钥,控制设备、用户与权限
USB-C 直连授权网络访问电脑调用模型 / Agent 服务
04

软件架构

用户入口HiApp(Wails / Tauri 壳) · 桌面端 Agent 商城 · 手机 App / 微信小程序
连接与数据私有 NAS / S3 协议、本地盘映射、Socks5 隐藏代理、受控网络访问
管理与治理HiManager · SecurityAudit · ApiGateway(Chat Completions / Responses 适配、用量统计)
资源与系统ResourceSchedule · SysMetrics · Registry(部署、卸载、监控、版本管理)
基础模型服务rkllm:统一提供本地模型能力;自动选择模型与运行配置
业务 Agent 容器自研或第三方 Agent 独立容器化运行,独立数据目录与挂载空间
05

应用生态与典型场景

安装

在电脑 HiApp 中浏览经过测试、汉化的 Agent,点击安装即可部署到盒子。

使用

电脑直接打开 Agent 的 Web 页面;手机通过 App 或微信小程序发起请求。

联网

需要外部信息时,Agent 使用 web_search;网络能力受盒子与 HiApp 的权限管控。

调用

OpenClaw 等电脑工具通过标准 LLM API 直接使用盒子的模型服务。

外出场景

手机查项目资料

“帮我看下上个月做的 XXX 项目,用到的钢材来自哪个公司,什么型号?”盒子检索已同步的数据并给出答案。

电脑场景

Agent 商城与本地服务

电脑只承担入口和展示,Agent 的服务端与数据运行在盒子内,形成可安装、可卸载、可重置的个人 AI 环境。

06

第一版需要验证的关键问题

建议把“体验指标”置于“模型参数”之前:先用真实任务验证首字延迟、持续输出速度、长上下文稳定性、联网权限和数据迁移,再锁定最终芯片与模型组合。