正在阅读:

让端侧AI从“能跑”到“能用”,明略科技(2718.HK)如何打出一套完整牌?

扫一扫下载界面新闻APP

让端侧AI从“能跑”到“能用”,明略科技(2718.HK)如何打出一套完整牌?

端侧AI的竞争格局,正在从"谁先跑通"转向"谁的体系更完整"。对于正在评估AI落地路径的企业来说,这或许是当前最值得关注的信号之一。

IDC在面向中国市场的2026年预测中判断,到2028年,50%的企业将把推理类应用部署到边缘侧,以支持收入增长、客户体验改善或内部流程优化。大模型应用的讨论重心,正在从"模型能做什么"转向"模型在哪里运行、以什么成本运行,以及如何进入业务流程"。

这不是一个假设性的问题。对于那些正在评估AI自动化方案的企业而言,云端还是端侧,已经是一道必须做出选择的题。

云端AI在企业场景撞上的三堵墙

过去两年,以ChatGPT、Claude为代表的云端大模型几乎重新定义了人们对AI的预期。然而当企业试图将这些能力真正嵌入自己的业务流程时,三个结构性的问题开始浮出水面。

第一堵墙是数据安全。当AI需要操作电脑界面——读取财务报表、处理客户数据、操作内部系统——它必须持续截取屏幕画面进行理解。在云端架构下,这些截图需要上传到远程服务器,而屏幕上往往承载着企业最敏感的信息。即便服务商承诺"不存储",数据曾经离开设备的事实本身,在《数据安全法》和GDPR的合规框架下已经构成风险。对于金融、医疗、政务等行业,"数据不出域"不是偏好,是刚性要求。

第二堵墙是成本。云端模型按Token或调用次数计费,而GUI操作场景下,AI需要高频处理高分辨率屏幕截图——每一次"看屏幕"都是一次视觉推理调用。一个真正有用的AI助手应当具备主动性:自动检查邮箱、预判会议安排、监控系统异常。但在云端架构下,每一次主动运算都是平台侧的成本支出。当数百万用户同时使用,主动服务频次越高,平台费用越不可控。这从根本上限制了云端AI的"主动性"——不是不想主动,是主动不起。

第三堵墙是可用性。目前市面上的端侧AI方案,大多停留在"能聊天"的阶段。真正能在本地设备上看懂屏幕、理解界面语义、操作桌面软件的GUI智能体,几乎是空白。企业想要的不只是一个本地跑的语言模型,而是一个能替人干活的端侧操作助手。

趋势转折:硬件、框架、算法同步就位

好消息是,2026年端侧AI的基础条件正在快速成熟。

Apple M系列芯片的Neural Engine算力持续刷新记录,MLX等端侧推理框架生态日趋完善,量化和剪枝技术让大模型在"瘦身"的同时保持核心能力。多种因素叠加之下,端侧模型部署已经从"能不能跑"进入"跑得好不好、跑得省不省"的新阶段。

更值得关注的是端侧方案三个云端无法弥补的结构性优势:物理隔离级的数据安全——截图和任务数据从头到尾不离开本地硬件;完全离线可用——不依赖网络,7×24小时随时待命;边际成本趋零——算力用的是用户自己的芯片,AI跑一万次也不产生额外费用。

这意味着,端侧部署不再是"极客玩具"或"备选方案",而正在成为AI产品落地的标准配置。尤其对于GUI Agent这个品类,端侧几乎是唯一合理的技术路线。

不只做一个"小模型":明略科技的系统化思路

在这场端侧AI的竞争中,明略科技(港交所:2718.HK)给出了一个值得关注的样本。它没有止步于做一个"能在本地跑的小模型",而是沿着"模型—引擎—协作—入口"四个层次,构建了一套完整的端侧智能能力栈。

模型层面,明略科技于2026年3月在GitHub上开源了Mano-P——一款端侧GUI-VLA(Vision-Language-Action)智能体模型。与传统RPA依赖API和预设规则不同,Mano-P通过纯视觉方式理解图形界面,能够自适应地识别按钮、输入框、菜单项的语义位置,在桌面软件、网页系统和复杂工作流中自主规划操作步骤。其72B完整版在OSWorld基准测试中以58.2%的成功率拿下专用模型全球第一,领先第二名超过13个百分点;在WebRetriever Protocol I评测中,41.7的NavEval得分超过了Gemini 2.5 Pro Computer Use的40.9和Claude 4.5 Computer Use的31.3。

72B版本证明技术上限,但日常使用靠的是蒸馏而成的4B量化版。实测数据显示,4B模型在Apple M4 Pro上预填充速度达到476 tokens/s,解码速度76 tokens/s,峰值内存占用仅4.3GB,首次响应延迟低于1秒。这意味着一台普通MacBook Pro就能流畅运行GUI智能体,同时不影响日常办公。所有截图、交互过程和任务数据全程锁定在本地设备中,实现物理隔离级的隐私安全。

引擎层面,明略科技自研并开源了端侧推理加速框架Cider。基于Apple MLX生态构建,Cider补齐了MLX原生框架在激活量化与特定张量计算上的能力缺口。实测中,Cider在W8A8模式下算子速度较原生MLX提升约1.4至1.9倍;W4A8模式下,能比W8A8进一步降低50%的权重内存占用。针对Qwen3-VL系列视觉语言模型,Cider为4B模型带来了17%至22%的预填充加速,2B模型上加速幅度更达到57%至61%。此外,Cider还探索了基于M4芯片的Apple Neural Engine与GPU异构协同,在部分场景下额外获得3%至16%的性能提升。

在端侧模型矩阵的延伸上,明略科技还发布了面向垂直领域的端侧语音识别模型OctoASR,深度适配会议纪要、技术讨论、产品评审等高频办公场景。同时,公司在2026年中报中披露了Scaling Out模型构建新范式——经该方法构建的模型在目标能力域上性能与前沿模型基本持平,且显著优于同参数量级的蒸馏模型。基于这一方法,明略科技已打造多款端侧通用模型,覆盖多模态理解、智能体操作和通用认知推理三大核心能力域,可根据客户场景灵活组合与定制模型尺寸。

更大的拼图:四层架构与组织级智能

如果只看单一产品线,明略科技的端侧模型能力已经具备竞争力。但更值得注意的是,这些产品并非孤立存在。

根据公开信息,明略科技的端侧AI产品矩阵呈现出清晰的四层结构:Mano-P负责端侧智能体的理解和决策,Cider负责推理加速与硬件算力释放,Octo(开源可信Agent协作网络)负责多Agent协作和组织级编排,Octic(AI原生录音硬件)负责线下场景的数据采集入口。四个产品分别对应模型、引擎、协作网络、硬件四个层次,全部已开源或已发布。

这一架构的意义在于,端侧AI的竞争已不只是"谁的模型更小更快"的参数之争,而是一场关于系统能力的综合较量。一个端侧模型再强,如果缺乏推理加速的工程支撑,就难以在消费级设备上达到生产可用的水准;如果不能与组织内的其他Agent协同工作,就只是一个孤立的单体工具;如果没有真实数据的持续输入,就无法形成可迭代的应用闭环。

端侧AI进入系统竞争

站在2026年下半年的时间节点回看,端侧AI的产业化进程比多数人预期的要快。硬件算力、推理框架、量化技术的同步成熟,为端侧模型的生产级部署扫清了最后几道工程障碍。而企业端对数据安全、部署成本和AI主动服务能力的真实需求,正在把端侧方案从"可选项"推向"必选项"。

明略科技的做法提供了一个具有参考价值的行业样本:不是在单一维度上追求极致参数或跑分,而是从模型能力、推理效率、组织协作到数据入口,构建端侧AI的完整能力体系。基于Apache 2.0等协议的全面开源,也让这套方案的技术细节完全透明、可审计、可商用。

端侧AI的竞争格局,正在从"谁先跑通"转向"谁的体系更完整"。对于正在评估AI落地路径的企业来说,这或许是当前最值得关注的信号之一。


未经正式授权严禁转载本文,侵权必究。如需转载请联系:youlianyunpindao@163.com
以上内容与数据仅供参考,与界面有连云频道立场无关,不构成投资建议,使用前请核实。据此操作,风险自担。

评论

暂无评论哦,快来评价一下吧!

下载界面新闻

微信公众号

微博

让端侧AI从“能跑”到“能用”,明略科技(2718.HK)如何打出一套完整牌?

端侧AI的竞争格局,正在从"谁先跑通"转向"谁的体系更完整"。对于正在评估AI落地路径的企业来说,这或许是当前最值得关注的信号之一。

IDC在面向中国市场的2026年预测中判断,到2028年,50%的企业将把推理类应用部署到边缘侧,以支持收入增长、客户体验改善或内部流程优化。大模型应用的讨论重心,正在从"模型能做什么"转向"模型在哪里运行、以什么成本运行,以及如何进入业务流程"。

这不是一个假设性的问题。对于那些正在评估AI自动化方案的企业而言,云端还是端侧,已经是一道必须做出选择的题。

云端AI在企业场景撞上的三堵墙

过去两年,以ChatGPT、Claude为代表的云端大模型几乎重新定义了人们对AI的预期。然而当企业试图将这些能力真正嵌入自己的业务流程时,三个结构性的问题开始浮出水面。

第一堵墙是数据安全。当AI需要操作电脑界面——读取财务报表、处理客户数据、操作内部系统——它必须持续截取屏幕画面进行理解。在云端架构下,这些截图需要上传到远程服务器,而屏幕上往往承载着企业最敏感的信息。即便服务商承诺"不存储",数据曾经离开设备的事实本身,在《数据安全法》和GDPR的合规框架下已经构成风险。对于金融、医疗、政务等行业,"数据不出域"不是偏好,是刚性要求。

第二堵墙是成本。云端模型按Token或调用次数计费,而GUI操作场景下,AI需要高频处理高分辨率屏幕截图——每一次"看屏幕"都是一次视觉推理调用。一个真正有用的AI助手应当具备主动性:自动检查邮箱、预判会议安排、监控系统异常。但在云端架构下,每一次主动运算都是平台侧的成本支出。当数百万用户同时使用,主动服务频次越高,平台费用越不可控。这从根本上限制了云端AI的"主动性"——不是不想主动,是主动不起。

第三堵墙是可用性。目前市面上的端侧AI方案,大多停留在"能聊天"的阶段。真正能在本地设备上看懂屏幕、理解界面语义、操作桌面软件的GUI智能体,几乎是空白。企业想要的不只是一个本地跑的语言模型,而是一个能替人干活的端侧操作助手。

趋势转折:硬件、框架、算法同步就位

好消息是,2026年端侧AI的基础条件正在快速成熟。

Apple M系列芯片的Neural Engine算力持续刷新记录,MLX等端侧推理框架生态日趋完善,量化和剪枝技术让大模型在"瘦身"的同时保持核心能力。多种因素叠加之下,端侧模型部署已经从"能不能跑"进入"跑得好不好、跑得省不省"的新阶段。

更值得关注的是端侧方案三个云端无法弥补的结构性优势:物理隔离级的数据安全——截图和任务数据从头到尾不离开本地硬件;完全离线可用——不依赖网络,7×24小时随时待命;边际成本趋零——算力用的是用户自己的芯片,AI跑一万次也不产生额外费用。

这意味着,端侧部署不再是"极客玩具"或"备选方案",而正在成为AI产品落地的标准配置。尤其对于GUI Agent这个品类,端侧几乎是唯一合理的技术路线。

不只做一个"小模型":明略科技的系统化思路

在这场端侧AI的竞争中,明略科技(港交所:2718.HK)给出了一个值得关注的样本。它没有止步于做一个"能在本地跑的小模型",而是沿着"模型—引擎—协作—入口"四个层次,构建了一套完整的端侧智能能力栈。

模型层面,明略科技于2026年3月在GitHub上开源了Mano-P——一款端侧GUI-VLA(Vision-Language-Action)智能体模型。与传统RPA依赖API和预设规则不同,Mano-P通过纯视觉方式理解图形界面,能够自适应地识别按钮、输入框、菜单项的语义位置,在桌面软件、网页系统和复杂工作流中自主规划操作步骤。其72B完整版在OSWorld基准测试中以58.2%的成功率拿下专用模型全球第一,领先第二名超过13个百分点;在WebRetriever Protocol I评测中,41.7的NavEval得分超过了Gemini 2.5 Pro Computer Use的40.9和Claude 4.5 Computer Use的31.3。

72B版本证明技术上限,但日常使用靠的是蒸馏而成的4B量化版。实测数据显示,4B模型在Apple M4 Pro上预填充速度达到476 tokens/s,解码速度76 tokens/s,峰值内存占用仅4.3GB,首次响应延迟低于1秒。这意味着一台普通MacBook Pro就能流畅运行GUI智能体,同时不影响日常办公。所有截图、交互过程和任务数据全程锁定在本地设备中,实现物理隔离级的隐私安全。

引擎层面,明略科技自研并开源了端侧推理加速框架Cider。基于Apple MLX生态构建,Cider补齐了MLX原生框架在激活量化与特定张量计算上的能力缺口。实测中,Cider在W8A8模式下算子速度较原生MLX提升约1.4至1.9倍;W4A8模式下,能比W8A8进一步降低50%的权重内存占用。针对Qwen3-VL系列视觉语言模型,Cider为4B模型带来了17%至22%的预填充加速,2B模型上加速幅度更达到57%至61%。此外,Cider还探索了基于M4芯片的Apple Neural Engine与GPU异构协同,在部分场景下额外获得3%至16%的性能提升。

在端侧模型矩阵的延伸上,明略科技还发布了面向垂直领域的端侧语音识别模型OctoASR,深度适配会议纪要、技术讨论、产品评审等高频办公场景。同时,公司在2026年中报中披露了Scaling Out模型构建新范式——经该方法构建的模型在目标能力域上性能与前沿模型基本持平,且显著优于同参数量级的蒸馏模型。基于这一方法,明略科技已打造多款端侧通用模型,覆盖多模态理解、智能体操作和通用认知推理三大核心能力域,可根据客户场景灵活组合与定制模型尺寸。

更大的拼图:四层架构与组织级智能

如果只看单一产品线,明略科技的端侧模型能力已经具备竞争力。但更值得注意的是,这些产品并非孤立存在。

根据公开信息,明略科技的端侧AI产品矩阵呈现出清晰的四层结构:Mano-P负责端侧智能体的理解和决策,Cider负责推理加速与硬件算力释放,Octo(开源可信Agent协作网络)负责多Agent协作和组织级编排,Octic(AI原生录音硬件)负责线下场景的数据采集入口。四个产品分别对应模型、引擎、协作网络、硬件四个层次,全部已开源或已发布。

这一架构的意义在于,端侧AI的竞争已不只是"谁的模型更小更快"的参数之争,而是一场关于系统能力的综合较量。一个端侧模型再强,如果缺乏推理加速的工程支撑,就难以在消费级设备上达到生产可用的水准;如果不能与组织内的其他Agent协同工作,就只是一个孤立的单体工具;如果没有真实数据的持续输入,就无法形成可迭代的应用闭环。

端侧AI进入系统竞争

站在2026年下半年的时间节点回看,端侧AI的产业化进程比多数人预期的要快。硬件算力、推理框架、量化技术的同步成熟,为端侧模型的生产级部署扫清了最后几道工程障碍。而企业端对数据安全、部署成本和AI主动服务能力的真实需求,正在把端侧方案从"可选项"推向"必选项"。

明略科技的做法提供了一个具有参考价值的行业样本:不是在单一维度上追求极致参数或跑分,而是从模型能力、推理效率、组织协作到数据入口,构建端侧AI的完整能力体系。基于Apache 2.0等协议的全面开源,也让这套方案的技术细节完全透明、可审计、可商用。

端侧AI的竞争格局,正在从"谁先跑通"转向"谁的体系更完整"。对于正在评估AI落地路径的企业来说,这或许是当前最值得关注的信号之一。

未经正式授权严禁转载本文,侵权必究。