使用手册 · 快速上手

HanCore AI 工作站使用指南

从安装到精通——半小时内让你的智能体上线工作。

阅读约 15 分钟 Windows 10+ x64 v1.0

01下载与安装

HanCore AI 工作站目前支持 Windows 10 及以上系统(x64)。安装包内置了 CPU 和 Vulkan 推理后端,安装后即可使用,无需额外下载。

1

下载安装包

从铭瀚芯官网下载 AIWorkstation-Setup-x.x.x.exe(NSIS 安装包,约 400MB)。

ⓘ 安装包内含什么

Electron 桌面应用 + Python 离线运行时 + llama.cpp 推理引擎(CPU + Vulkan)。NVIDIA 显卡用户首启动后会自动下载 CUDA 后端。

2

运行安装程序

双击 .exe 安装包,按提示完成安装。建议安装到纯英文路径(如 D:\AIWorkstation)。

⚠ 中文路径限制

llama.cpp 在 Windows 下不能稳定读取中文路径。请确保安装路径GGUF 模型文件路径Chat 模板路径mmproj 路径全部为纯英文。例如:D:/Models/Qwen2.5-32B.gguf ✓ D:/模型/Qwen.gguf

3

首次启动

安装完成后,从开始菜单启动 AIWorkstation。首次启动会自动初始化 Python 运行时(约 10-30 秒),无需联网。

启动完成后,你会看到 License 激活界面。

02激活 License

首次启动 HanCore 需要输入 License Key 完成激活。License 绑定你的机器硬件指纹,激活后离线也可使用。

1

输入 License Key

在 License 激活界面输入你购买的授权密钥,点击「验证」。

系统会联网验证 Key 有效性,并将授权信息绑定到你的机器。

2

验证通过后进入主界面

验证成功后,License 信息会持久化存储在系统目录(非浏览器缓存,清除浏览器数据不会丢失激活状态)。

之后每次启动,如果检测到已激活的 License,将直接进入主界面。

✅ 离线使用

License 首次激活需要联网。激活成功后,后续使用完全离线——系统会通过本地公钥验签 + 硬件指纹比对来验证授权。

03加载第一个模型

HanCore 使用 GGUF 格式的开源大模型。你需要先下载一个 GGUF 模型文件,然后在工作站中添加它。

推荐模型

模型参数量最低 VRAM推荐场景
Qwen2.5-32B32B8 GB综合能力最强,128K 上下文
Qwen2.5-14B14B4 GB均衡选择,速度与质量兼顾
GLM-4-9B9B3 GB中文场景表现优秀
Llama-3-8B8B2 GB英文场景,轻量快速
Qwen2-VL7B3 GB视觉模型(图片理解)

添加模型步骤

1

打开模型中心

在左侧导航栏点击「本地模型」图标,进入模型管理页面。

2

点击「添加模型」

在卡片网格中点击虚线框的「添加」卡片,打开模型配置抽屉。

3

填写模型信息

在右侧 Sheet 抽屉中填写以下字段:

字段说明
名称模型的显示名称(如 Qwen2.5-32B)
模型路径GGUF 文件路径,点「选择文件」浏览(纯英文路径!)
上下文长度默认 131072(128K),最低不可低于此值
并行槽位默认 2,影响同时处理的请求数
后端偏好auto(推荐)/ cuda12 / vulkan / cpu
4

保存并启动

点击「保存」,模型卡片出现在列表中。点击卡片上的「启动」按钮,工作站会:

  1. 自动检测你的 GPU 并选择最优后端(CUDA/Vulkan/CPU)
  2. 启动 llama-server 推理进程
  3. 将推理端点注册到 Hermes 对话引擎
  4. 状态变为「运行中」🆕
✅ 快速扫描

如果你已有一目录的 GGUF 文件,可以在模型中心使用「扫描目录」功能,自动发现目录下所有 .gguf 文件,然后逐个配置添加。

04开始第一次对话

模型启动后,点击左侧导航的「对话」进入聊天界面。你现在可以和本地 AI 对话了——所有推理在你的 CPU/GPU 上完成,文件不上传任何服务器。

试试这些操作

  • 直接聊天:输入消息,AI 回复。和 ChatGPT 类似,但全程本地。
  • 上传文件:拖入 PDF / DOCX / TXT / 代码文件,AI 能读取并分析内容。
  • 写代码:要求 AI 编写/修改代码,如果激活了编程专家角色,它还能直接执行终端命令。
  • 分析数据:拖入 Excel/CSV 文件,AI 读取并生成分析报告。
ⓘ 上下文窗口说明

HanCore 默认配置 128K 上下文窗口。如果对话超长导致 AI "遗忘"前文,可以尝试增大 上下文长度 参数(但需更多 VRAM)。

05模型管理进阶

模型参数详解

参数默认值说明
contextLength131072单 slot 上下文长度。Hermes agent 需要 ≥128K。注意:实际单会话 = ctx ÷ parallel
parallelSlots2并行推理槽位数。--parallel N 将 ctx 分成 N 份
backendPreferenceautoauto 自动选择;可手动指定 cuda12/vulkan/cpu
reasoningModeoff推理链模式:off/auto/on。某些模型开启后会输出思考过程
isVisualModelfalse视觉模型需额外指定 mmprojPath(投影文件路径)
chatTemplatePathJinja 模板路径,特殊模型可能需要自定义对话模板

GPU 后端选择

HanCore 自动检测你的 GPU 并选择最优后端。如果你想手动指定(例如测试或排查问题):

GPU 品牌推荐后端说明
NVIDIAcuda12最佳性能。需要 CUDA 运行时(首启动自动下载)
AMDvulkanVulkan 通用 GPU 加速,随安装包内置
Intelvulkan同上
无独立显卡cpuCPU 推理,速度较慢但功能完整

VRAM 与上下文调优

--ctx-size每个 slot 的上下文,不是总量。--parallel N 会把 ctx 分成 N 个 slot。

⚠ 常见误区

如果你设置 ctx-size=65536 + parallel=2,那么单次对话只能使用 32768 tokens 的上下文。而 Hermes agent 处理复杂任务时 input 可能达到 40-50K tokens,导致溢出。

建议:保持默认 ctx-size=131072。如需降低,参考下表。

VRAM推荐配置适用模型
16 GBctx 65536 + parallel 1Qwen2.5-32B(量化)
32 GB+ctx 131072 + parallel 2Qwen2.5-32B / GLM-4
8 GBctx 32768 + parallel 1Qwen2.5-14B / 8B 模型
无 GPUctx 32768 + parallel 18B 以下模型(CPU 推理)
💡 KV Cache 量化(可选优化)

VRAM 紧张时可添加 --cache-type-k q8_0 参数对 KV Cache 进行量化,减少显存占用(略微影响质量)。此功能需要通过自定义模型配置添加。

06智能体:安装你的 AI 助手

AIWS 支持多种 AI 桌面助手(Hermes、OpenClaw、OpenCode 等),统一在「智能体」页管理:安装状态、版本信息与运行情况一目了然。各智能体定位详见 产品功能介绍 · 智能体阵容

安装与启停

1

打开智能体管理

在左侧导航点击「智能体」,进入智能体管理页面;已安装与未安装的智能体分列展示。

2

一键安装

选择需要的智能体(如 OpenCode),点击「安装」,安装完成后状态显示为已安装、待启动。

3

启动

点击「启动」即可运行该智能体;运行中的智能体可一键停止。安装与运行状态在卡片上即时更新。

4

停止 / 卸载

点击「停止」让智能体下线;如不再需要,可在管理页卸载,配置与数据目录会按提示处理。

ⓘ 单实例约束

同一时间只能有一个桌面模式的智能体处于运行状态,启动新的智能体时会自动停止之前的智能体;网关模式的接入(如微信机器人)独立运行,不受此限制。

配置工具与技能

安装智能体后,点击卡片的配置按钮打开右侧抽屉,可以精细控制其权限。

工具集(Toolsets)

工具能力
file读写本地文件
web联网搜索和网页抓取
terminal执行终端/命令行命令
browser浏览器自动化操作
code_execution沙箱内执行 Python 代码
vision图片理解和分析
image_gen图片生成
video_gen视频生成
skills调用已安装的 AI 技能
todo任务管理和清单
memory长期记忆存储
delegation委派任务给其他智能体
tts语音合成(文字转语音)

根据智能体定位按需勾选。例如编程类助手通常需要 file + terminal + web。

行为准则定制(SOUL.md)

部分智能体的行为准则由 SOUL.md 文件定义,启动时写入工作目录;可按需修改,调整其回复风格与边界。

07微信接入(Gateway 模式)

微信接入通过独立网关进程运行,为 Hermes / OpenClaw 接入微信机器人;新联系人首次对话需经你批准。

⚠ 前置条件

微信接入需要安装额外的 Python 依赖包(aiohttpcryptography)。首次绑定时会自动检查并提示安装。

1

安装微信接入

在「AI 辅助」页安装微信接入。微信接入为 gateway 模式,拥有独立的网关进程。

2

扫码绑定

点击微信助手的「渠道绑定」按钮,打开 3 步向导:

  1. 依赖检查 — 确认 aiohttp / cryptography 已安装
  2. QR 扫码 — 用手机微信扫描屏幕上的二维码,等待确认
  3. 访问策略 — 配置私聊策略(dmPolicy)和群聊策略(groupPolicy)

扫码确认后,微信凭证会自动写入配置文件。

3

激活并启动 Gateway

绑定成功后,激活微信助手。系统会自动:

  1. 确保 llama-server 推理引擎就绪(ctx ≥ 131072)
  2. 写入 SOUL.md(客服人格设定)
  3. 配置工具权限和技能
  4. 启动 Gateway Python 进程
  5. 状态变为 working
4

测试收发消息

用另一个微信号给你的 AI 微信号发消息,AI 会自动回复。你可以在对话界面查看消息记录和回复内容。

停止微信助手时,Gateway 进程会自动退出。

08多平台接入(陆续开放)

ⓘ 当前开放状态

微信、飞书接入已上线可用;WhatsApp / Gmail / Outlook / Telegram / Discord / Google Chat 处于待接入状态,将陆续开放。以下流程以已上线平台为准。

除了微信,HanCore 还支持通过凭证表单快速接入其他主流即时通讯平台。Hermes 引擎内置了 24+ 平台适配器,零改动复用。

钉钉(DingTalk)

  • 在钉钉开放平台创建自定义机器人,获取 client_idclient_secret
  • 在渠道绑定面板中选择「钉钉」,填入凭证
  • 保存后激活即可

飞书(Feishu)

  • 在飞书开发者后台创建应用,获取 app_idapp_secret
  • 在渠道绑定面板中选择「飞书」,填入凭证
  • 保存后激活即可

Telegram

  • 在 Telegram 中找 @BotFather 创建 Bot,获取 bot_token
  • 在渠道绑定面板中选择「Telegram」,填入 Bot Token
  • 保存后激活即可
💡 扩展新平台

HanCore 的消息平台采用适配器架构(PlatformAdapter 接口)。开发者可以实现新平台的适配器并注册,无需修改核心 Gateway 代码。

09常见问题排查

模型启动失败

错误:中文路径导致 llama.cpp 失败

症状:模型启动时报路径错误或直接崩溃。

解决:检查 GGUF 文件路径、Chat 模板路径、mmproj 路径是否包含中文字符。将模型文件移动到纯英文目录,如 D:/Models/

错误:VRAM 不足 / OOM

症状:模型加载到一半报错,或推理时崩溃。

解决

  • 降低 contextLength(如从 131072 降到 65536 或 32768)
  • 设置 parallelSlots 为 1
  • 使用参数量更小的模型(如 14B 代替 32B)
  • 使用量化版本(如 Q4_K_M 而非 FP16)

对话响应异常

问题:AI 忘记之前说过的话

原因:上下文窗口不足。实际单会话可用 = ctx ÷ parallel。

解决:增大 contextLength 或将 parallelSlots 设为 1。注意 VRAM 消耗会相应增加。

问题:切换模型后对话仍用旧模型

原因:模型切换仅影响新会话。已有的对话窗口不会自动切换。

解决:开一个新对话即可使用新模型。

进程残留

问题:异常退出后 llama-server 进程残留

原因:程序崩溃或强制关闭后,子进程可能仍在后台运行。

解决:HanCore 在启动时会自动检测并清理残留进程。如需手动清理:

# 查找残留的 llama-server 进程 tasklist | findstr llama-server # 强制终止 taskkill /F /IM llama-server.exe

微信绑定问题

问题:QR 扫码后一直等待

可能原因

  • 网络问题导致轮询超时——检查网络连接
  • 微信版本过低——更新到最新版微信
  • 凭证已过期——重新扫码绑定

10FAQ

不具备技术背景,能否正常使用?
可以。AIWS 的设计初衷即是消除技术门槛,你只需进行点击、选择与对话。
对话内容是否会被上传?
使用本地模型时不会上传,对话内容默认仅保存在你的电脑上。
网络中断后能否继续使用?
激活之后,一段宽限期内可正常离线使用;本地模型本身不依赖网络。
激活码与电脑绑定后,如何更换设备?
更换电脑等特殊情况,可通过官方渠道或你的供应商办理授权转移(设有年度次数限制,以防滥用)。
安装失败或无法启动时如何处理?
可直接咨询内置 AI 助理——它了解你电脑的当前状态,会给出针对性的中文排查建议;也可通过官网支持渠道联系人工客服。
能否查询自己的 AI 使用量?
可以。用量统计按助手、模型与时间维度清晰展示,无法精确统计之处均如实标注。
与直接使用 ChatGPT / Claude 有何区别?
概括为三点:更省(本地使用零 token 开销)、更安全(数据不离开本机)、断网可用。线上服务仍可作为补充,由你决定各类任务的分配方式。
没有独立显卡能用吗?
可以尝试运行,但速度会明显下降;建议优先在配备独立显卡(显存 8GB 以上)的电脑上使用。
支持哪些本地模型?
支持 GGUF 格式的开源模型(Qwen / GLM / Llama 等)。模型中心会在下载前检测显卡,无法流畅运行的模型会得到明确提示。
macOS 和 Linux 什么时候支持?
当前版本面向 Windows 10 / 11(64 位);其他平台的支持时间尚未确定,确定后将在官网公布。