使用手册 · 快速上手

HanCore AI 工作站使用指南

从安装到精通——半小时内让你的数字牛马上线工作。

阅读约 15 分钟 Windows 10+ x64 v1.0

01下载与安装

HanCore AI 工作站目前支持 Windows 10 及以上系统(x64)。安装包内置了 CPU 和 Vulkan 推理后端,安装后即可使用,无需额外下载。

1

下载安装包

从铭瀚芯官网下载 AIWorkstation-Setup-x.x.x.exe(NSIS 安装包,约 400MB)。

ⓘ 安装包内含什么

Electron 桌面应用 + Python 离线运行时 + llama.cpp 推理引擎(CPU + Vulkan)。NVIDIA 显卡用户首启动后会自动下载 CUDA 后端。

2

运行安装程序

双击 .exe 安装包,按提示完成安装。建议安装到纯英文路径(如 D:\AIWorkstation)。

⚠ 中文路径限制

llama.cpp 在 Windows 下不能稳定读取中文路径。请确保安装路径GGUF 模型文件路径Chat 模板路径mmproj 路径全部为纯英文。例如:D:/Models/Qwen2.5-32B.gguf ✓ D:/模型/Qwen.gguf

3

首次启动

安装完成后,从开始菜单启动 AIWorkstation。首次启动会自动初始化 Python 运行时(约 10-30 秒),无需联网。

启动完成后,你会看到 License 激活界面。

02激活 License

首次启动 HanCore 需要输入 License Key 完成激活。License 绑定你的机器硬件指纹,激活后离线也可使用。

1

输入 License Key

在 License 激活界面输入你购买的授权密钥,点击「验证」。

系统会联网验证 Key 有效性,并将授权信息绑定到你的机器。

2

验证通过后进入主界面

验证成功后,License 信息会持久化存储在系统目录(非浏览器缓存,清除浏览器数据不会丢失激活状态)。

之后每次启动,如果检测到已激活的 License,将直接进入主界面。

✅ 离线使用

License 首次激活需要联网。激活成功后,后续使用完全离线——系统会通过本地公钥验签 + 硬件指纹比对来验证授权。

03加载第一个模型

HanCore 使用 GGUF 格式的开源大模型。你需要先下载一个 GGUF 模型文件,然后在工作站中添加它。

推荐模型

模型参数量最低 VRAM推荐场景
Qwen2.5-32B32B8 GB综合能力最强,128K 上下文
Qwen2.5-14B14B4 GB均衡选择,速度与质量兼顾
GLM-4-9B9B3 GB中文场景表现优秀
Llama-3-8B8B2 GB英文场景,轻量快速
Qwen2-VL7B3 GB视觉模型(图片理解)

添加模型步骤

1

打开模型中心

在左侧导航栏点击「本地模型」图标,进入模型管理页面。

2

点击「添加模型」

在卡片网格中点击虚线框的「添加」卡片,打开模型配置抽屉。

3

填写模型信息

在右侧 Sheet 抽屉中填写以下字段:

字段说明
名称模型的显示名称(如 Qwen2.5-32B)
模型路径GGUF 文件路径,点「选择文件」浏览(纯英文路径!)
上下文长度默认 131072(128K),最低不可低于此值
并行槽位默认 2,影响同时处理的请求数
后端偏好auto(推荐)/ cuda12 / vulkan / cpu
4

保存并启动

点击「保存」,模型卡片出现在列表中。点击卡片上的「启动」按钮,工作站会:

  1. 自动检测你的 GPU 并选择最优后端(CUDA/Vulkan/CPU)
  2. 启动 llama-server 推理进程
  3. 将推理端点注册到 Hermes 对话引擎
  4. 状态变为「运行中」🆕
✅ 快速扫描

如果你已有一目录的 GGUF 文件,可以在模型中心使用「扫描目录」功能,自动发现目录下所有 .gguf 文件,然后逐个配置添加。

04开始第一次对话

模型启动后,点击左侧导航的「对话」进入聊天界面。你现在可以和本地 AI 对话了——所有推理在你的 CPU/GPU 上完成,文件不上传任何服务器。

试试这些操作

  • 直接聊天:输入消息,AI 回复。和 ChatGPT 类似,但全程本地。
  • 上传文件:拖入 PDF / DOCX / TXT / 代码文件,AI 能读取并分析内容。
  • 写代码:要求 AI 编写/修改代码,如果激活了编程专家角色,它还能直接执行终端命令。
  • 分析数据:拖入 Excel/CSV 文件,AI 读取并生成分析报告。
ⓘ 上下文窗口说明

HanCore 默认配置 128K 上下文窗口。如果对话超长导致 AI "遗忘"前文,可以尝试增大 上下文长度 参数(但需更多 VRAM)。

05模型管理进阶

模型参数详解

参数默认值说明
contextLength131072单 slot 上下文长度。Hermes agent 需要 ≥128K。注意:实际单会话 = ctx ÷ parallel
parallelSlots2并行推理槽位数。--parallel N 将 ctx 分成 N 份
backendPreferenceautoauto 自动选择;可手动指定 cuda12/vulkan/cpu
reasoningModeoff推理链模式:off/auto/on。某些模型开启后会输出思考过程
isVisualModelfalse视觉模型需额外指定 mmprojPath(投影文件路径)
chatTemplatePathJinja 模板路径,特殊模型可能需要自定义对话模板

GPU 后端选择

HanCore 自动检测你的 GPU 并选择最优后端。如果你想手动指定(例如测试或排查问题):

GPU 品牌推荐后端说明
NVIDIAcuda12最佳性能。需要 CUDA 运行时(首启动自动下载)
AMDvulkanVulkan 通用 GPU 加速,随安装包内置
Intelvulkan同上
无独立显卡cpuCPU 推理,速度较慢但功能完整

VRAM 与上下文调优

--ctx-size每个 slot 的上下文,不是总量。--parallel N 会把 ctx 分成 N 个 slot。

⚠ 常见误区

如果你设置 ctx-size=65536 + parallel=2,那么单次对话只能使用 32768 tokens 的上下文。而 Hermes agent 处理复杂任务时 input 可能达到 40-50K tokens,导致溢出。

建议:保持默认 ctx-size=131072。如需降低,参考下表。

VRAM推荐配置适用模型
16 GBctx 65536 + parallel 1Qwen2.5-32B(量化)
32 GB+ctx 131072 + parallel 2Qwen2.5-32B / GLM-4
8 GBctx 32768 + parallel 1Qwen2.5-14B / 8B 模型
无 GPUctx 32768 + parallel 18B 以下模型(CPU 推理)
💡 KV Cache 量化(可选优化)

VRAM 紧张时可添加 --cache-type-k q8_0 参数对 KV Cache 进行量化,减少显存占用(略微影响质量)。此功能需要通过自定义模型配置添加。

06数字牛马:雇佣你的 AI 员工

数字牛马是 HanCore 的核心特色——你可以雇佣 AI 员工,每个员工拥有独立角色、技能和工具权限。更多角色介绍详见 产品功能介绍 · 角色市场

雇佣流程

1

打开数字牛马

在左侧导航点击「数字牛马」图标,进入数字员工管理页面。你会看到两个标签:角色市场我的员工

2

从角色市场雇佣

在「角色市场」中选择一个角色(如「编程专家」),点击「雇佣」。角色会出现在「我的员工」列表中,状态为 idle(待命)。

3

激活员工

在「我的员工」中点击该员工的「激活」按钮。系统会:

  1. 写入该角色的 SOUL.md(人格定义文件)
  2. 配置该角色的工具权限(toolsets)和技能
  3. 状态变为 working(在岗)

激活后,新开的对话会自动使用该角色的设定。

4

停用 / 解雇

点击「停用」让员工下线(状态变为 offline),对话恢复默认设置。点击「解雇」则永久删除该员工实例(角色模板仍保留在市场中)。

ⓘ 单实例约束

同一时间只能有一个 Desktop 模式的数字牛马处于 working 状态。激活新员工时会自动停用之前的员工。Gateway 模式的员工(如微信助手)独立运行,不受此限制。

配置工具与技能

雇佣员工后,点击员工卡片的配置按钮打开右侧抽屉,可以精细控制该员工的权限。

13 种工具集(Toolsets)

工具能力
file读写本地文件
web联网搜索和网页抓取
terminal执行终端/命令行命令
browser浏览器自动化操作
code_execution沙箱内执行 Python 代码
vision图片理解和分析
image_gen图片生成
video_gen视频生成
skills调用已安装的 AI 技能
todo任务管理和清单
memory长期记忆存储
delegation委派任务给其他员工
tts语音合成(文字转语音)

根据角色定位按需勾选。例如「编程专家」通常需要 file + terminal + web,而「翻译官」只需要 web。

人格定制(SOUL.md)

每个角色的行为准则由 SOUL.md 文件定义。激活员工时,该文件会被写入到工作目录中,作为 AI 的"灵魂设定"。

你可以在角色市场中创建自定义角色,编写自己的 SOUL.md 来定义独特的 AI 员工人格——比如「财务审核员」「代码审查员」「社交媒体运营」等。

07微信接入(Gateway 模式)

微信助手角色通过 Gateway 独立进程运行,让你的 AI 员工自动回复微信消息。

⚠ 前置条件

微信接入需要安装额外的 Python 依赖包(aiohttpcryptography)。首次绑定时会自动检查并提示安装。

1

雇佣微信助手

在角色市场中雇佣「微信助手」角色。该角色为 gateway 模式,拥有独立的 Gateway 进程。

2

扫码绑定

点击微信助手的「渠道绑定」按钮,打开 3 步向导:

  1. 依赖检查 — 确认 aiohttp / cryptography 已安装
  2. QR 扫码 — 用手机微信扫描屏幕上的二维码,等待确认
  3. 访问策略 — 配置私聊策略(dmPolicy)和群聊策略(groupPolicy)

扫码确认后,微信凭证会自动写入配置文件。

3

激活并启动 Gateway

绑定成功后,激活微信助手。系统会自动:

  1. 确保 llama-server 推理引擎就绪(ctx ≥ 131072)
  2. 写入 SOUL.md(客服人格设定)
  3. 配置工具权限和技能
  4. 启动 Gateway Python 进程
  5. 状态变为 working
4

测试收发消息

用另一个微信号给你的 AI 微信号发消息,AI 会自动回复。你可以在对话界面查看消息记录和回复内容。

停止微信助手时,Gateway 进程会自动退出。

08钉钉 / 飞书 / Telegram 接入

除了微信,HanCore 还支持通过凭证表单快速接入其他主流即时通讯平台。Hermes 引擎内置了 24+ 平台适配器,零改动复用。

钉钉(DingTalk)

  • 在钉钉开放平台创建自定义机器人,获取 client_idclient_secret
  • 在渠道绑定面板中选择「钉钉」,填入凭证
  • 保存后激活即可

飞书(Feishu)

  • 在飞书开发者后台创建应用,获取 app_idapp_secret
  • 在渠道绑定面板中选择「飞书」,填入凭证
  • 保存后激活即可

Telegram

  • 在 Telegram 中找 @BotFather 创建 Bot,获取 bot_token
  • 在渠道绑定面板中选择「Telegram」,填入 Bot Token
  • 保存后激活即可
💡 扩展新平台

HanCore 的消息平台采用适配器架构(PlatformAdapter 接口)。开发者可以实现新平台的适配器并注册,无需修改核心 Gateway 代码。

09常见问题排查

模型启动失败

错误:中文路径导致 llama.cpp 失败

症状:模型启动时报路径错误或直接崩溃。

解决:检查 GGUF 文件路径、Chat 模板路径、mmproj 路径是否包含中文字符。将模型文件移动到纯英文目录,如 D:/Models/

错误:VRAM 不足 / OOM

症状:模型加载到一半报错,或推理时崩溃。

解决

  • 降低 contextLength(如从 131072 降到 65536 或 32768)
  • 设置 parallelSlots 为 1
  • 使用参数量更小的模型(如 14B 代替 32B)
  • 使用量化版本(如 Q4_K_M 而非 FP16)

对话响应异常

问题:AI 忘记之前说过的话

原因:上下文窗口不足。实际单会话可用 = ctx ÷ parallel。

解决:增大 contextLength 或将 parallelSlots 设为 1。注意 VRAM 消耗会相应增加。

问题:切换模型后对话仍用旧模型

原因:模型切换仅影响新会话。已有的对话窗口不会自动切换。

解决:开一个新对话即可使用新模型。

进程残留

问题:异常退出后 llama-server 进程残留

原因:程序崩溃或强制关闭后,子进程可能仍在后台运行。

解决:HanCore 在启动时会自动检测并清理残留进程。如需手动清理:

# 查找残留的 llama-server 进程 tasklist | findstr llama-server # 强制终止 taskkill /F /IM llama-server.exe

微信绑定问题

问题:QR 扫码后一直等待

可能原因

  • 网络问题导致轮询超时——检查网络连接
  • 微信版本过低——更新到最新版微信
  • 凭证已过期——重新扫码绑定

10FAQ

HanCore 需要联网才能用吗?
不需要。License 首次激活需联网,之后完全离线运行。安装包内置了 Python 运行时和 llama.cpp 引擎,所有推理在本地完成。
没有独立显卡能用吗?
可以。HanCore 支持 CPU 推理(速度较慢)和 Vulkan 通用 GPU 加速(AMD/Intel 显卡均可)。建议使用 8B 以下的小模型获得可接受的速度。
一个 License 可以在多台电脑上用吗?
不可以。License 绑定机器硬件指纹,一个 Key 只能在一台机器上激活。更换电脑需要联系客服转移授权。
支持哪些大模型?
所有 GGUF 格式的开源模型均支持,包括 Qwen 系列、Llama 系列、GLM 系列、Mistral 系列等。视觉模型(如 Qwen2-VL)也支持,需额外配置 mmproj 投影文件。
数字牛马能同时开几个?
Desktop 模式同一时间只能激活一个(单实例约束)。Gateway 模式的员工(如微信助手)独立运行,不受此限制。你可以在角色市场雇佣多个员工,按需切换激活。
微信接入安全吗?会被封号吗?
HanCore 使用官方 iLink Bot 接口接入微信,非第三方 hook 方案。但请合理使用,避免高频群发等异常行为。建议使用专用微信号作为 AI 客服号。
可以自定义数字牛马角色吗?
可以。在角色市场中点击「创建自定义角色」,填写角色名称、描述、SOUL.md 人格定义、工具权限和技能配置。自定义角色和官方角色使用方式完全一致。
macOS 和 Linux 什么时候支持?
当前版本仅支持 Windows 10+ x64。macOS 和 Linux 版本在路线图中,后续版本将提供支持。
如何查看模型实际加载的上下文大小?
模型启动后,可以访问 http://127.0.0.1:18080/props 端点(端口根据实际配置)查询真实的 n_ctx 值。
我的文件会被上传到哪里?
哪里都不会。HanCore 是本地 AI 工作站,所有文件读取、模型推理、对话处理都在你的电脑上完成。没有云端 API 调用,没有数据上传。你可以断网验证——一切照常工作。