超低功耗边缘AI芯片应具备哪些特点

情报边缘博客
    What to Look for in Ultra Low Power Edge AI Chips
    超低功耗边缘AI芯片应具备哪些特点 7

    可穿戴设备正变得越来越智能,但其电池容量却并未成比例地增加。

    从健康监测和活动识别,到始终在线的语音功能以及新兴的AI助手,人们对可穿戴设备能够实时感知、解读并响应周围世界的能力寄予了越来越高的期望。此外,越来越多的智能功能正转移到设备端,这不仅降低了对云连接的依赖,还提升了响应速度并增强了隐私保护。

    但每一项额外的工作负荷都会争夺同一份有限的能量储备。

    这改变了产品和工程团队在评估面向超低功耗可穿戴设备的边缘AI芯片时应采取的方式。AI峰值性能固然重要,但这仅仅是一个因素。对于电池供电的设备而言,更关键的问题是:

    在可用的功耗预算范围内,该系统能提供多少智能?

    在评估适用于超低功耗可穿戴设备的边缘AI芯片时,应优先考虑系统总功耗、与工作负载相匹配的高能效计算、内存和数据传输效率、动态功耗调节、始终在线的感知能力,以及能够使硬件切实可行的AI软件栈。仅凭峰值AI性能并不能决定电池续航时间。

    可穿戴AI能源的完整路径
    超低功耗边缘AI芯片应具备哪些特点 8

    1. 不要仅关注TOPS,而要着眼于整个系统的功耗

    人们通常会使用TOPS或GOPS等峰值性能指标来比较AI处理器。这些数值虽然有助于描述计算能力,但并不一定能反映可穿戴设备实际的运行情况。

    大多数可穿戴设备并未持续运行其最耗资源的AI工作负载。

    设备在其生命周期的大部分时间里,可能以极低的功耗监测传感器,定期唤醒以处理数据,在发生有意义的事件时进行推理,传输结果,然后返回低功耗状态。

    因此,整个运行周期内的能耗比孤立的加速器基准测试更为重要。

    在比较边缘AI硬件时,产品团队应考虑系统处理以下任务的效率:

    • 持续感知
    • 信号预处理
    • 内存访问与数据移动
    • AI推理
    • 连接性
    • 低功耗状态与高性能状态之间的切换

    目标不仅仅是尽可能降低推理功耗,而是要在确保提供所需用户体验的同时,尽可能降低系统的总功耗

    这种系统级方法是Ambiq公司SPOT®(亚阈值功耗优化技术)平台的核心。SPOT并非将低功耗视为针对单个工作负载的优化措施,而是旨在从半导体层面降低智能终端设备所需的所有功能的能耗。

    对于可穿戴设备设计师而言,这一区别至关重要。AI的能效首先取决于其底层的架构。

    2. 根据工作负载选择合适的AI硬件

    专用神经网络处理能够显著加快AI工作负载的处理速度。但这并不意味着每个可穿戴AI应用都需要一个始终运行的NPU——甚至未必需要NPU。

    根据工作负载匹配 AI 计算资源
    超低功耗边缘AI芯片应具备哪些特点 9

    许多始终在线的应用程序涉及相对紧凑的工作负载:传感器分类、关键词检测、动作识别、异常检测以及其他形式的连续监控。

    对于这些应用,更恰当的问题并不是:

    这款芯片有NPU吗?

    是:

    对于这一特定工作负载而言,哪种计算资源的能效最高?

    这意味着要评估整个计算架构,而不是只关注单一的加速器。

    Ambiq 的Apollo510正是这种设计理念的典范。Apollo510 基于搭载 Helium™ 技术的 Arm® Cortex®-M55 处理器和 Ambiq 的 SPOT 平台构建,旨在无需专用 NPU 的情况下运行广泛的人工智能工作负载,包括低功耗传感器监控和始终在线的语音应用。

    对于产品团队而言,根据工作负载选择合适的计算架构,有助于避免在应用程序并不需要的性能上浪费能源和芯片资源。

    随着模型的要求越来越高,专用的人工智能加速技术变得越来越有价值。因此,该架构需要一条能够有效扩展的途径。

    3. 观察功耗如何随工作负载变化

    可穿戴计算本质上是动态的。设备在监控输入时可能只需极少的功耗,但在处理事件时功耗会显著增加,而在执行复杂的AI工作负载时,又需要达到另一级别的性能。

    功耗如何随AI工作负载变化
    超低功耗边缘AI芯片应具备哪些特点 10

    一种围绕单一工作点优化的架构,在这些过渡过程中可能效率低下。

    对于超低功耗可穿戴设备,硬件应能够根据工作负载调整性能——从而调整能耗。

    Ambiq 的 SPOT 架构正是基于这一原则构建的。turboSPOT®等技术可在工作负载需要时提供更高的处理性能,同时保持专为超低功耗运行而设计的架构。随着可穿戴设备 AI 工作负载的不断扩展,这一原则变得愈发重要。

    Ambiq 的下一代Atomiq™架构将超低功耗设计理念延伸至专用神经网络处理领域。Atomiq 将 SPOT 技术与 Arm® Ethos™-U85 NPU 相结合,可提供超过 200 GOPS 的 AI 性能。 其动态电压和频率调节架构旨在覆盖超低功耗、低功耗和高性能三种运行模式,其中包括一种专为接近 300 mV 电压下工作而设计的超低功耗模式。

    关键之处并不仅仅在于处理器能否运行迅速或功耗极低。

    关键在于,随着工作负载的变化,该架构能否在这些工作点之间高效地切换。

    对于始终在线的AI而言,这些过渡过程对电池续航时间的重要性,不亚于推理过程本身的效率。

    4. 不要忽视内存和数据移动

    在讨论AI芯片能效时,计算往往备受关注。但执行运算只是能耗方程的一部分。数据还必须传输到那里。

    边缘AI系统中的内存与数据迁移
    超低功耗边缘AI芯片应具备哪些特点 11

    模型权重、传感器输入、中间激活值和应用数据在内存与计算资源之间持续传输。这些传输会消耗能量。如果内存架构效率低下,数据传输可能会抵消专用AI处理所带来的一部分效益。

    因此,产品和工程团队不应仅关注计算规格,还应考察:

    • 可用片上内存
    • 内存带宽
    • 模型和权重存储
    • 数据保留
    • 内存访问模式
    • 存储与计算资源的邻近性

    模型规模越大、结构越复杂,这些因素就越重要。

    这一点对于可穿戴设备而言尤为重要,因为增加外部存储器可能会导致功耗、成本、电路板占用空间以及系统复杂度的增加。

    因此,高效的设备端AI不仅在于高效地进行计算,还在于减少传输和存储计算所需数据所需的能耗。

    5. 将“始终在线”的感知功能融入AI架构

    许多可穿戴AI体验,早在神经网络运行之前就已经开始了。

    设备在等待有意义的事情发生的同时,可能会持续监测运动、音频、生理信号、环境输入或其他传感器数据流。

    如果为这些任务持续运行性能最高的处理资源,会迅速削弱边缘AI在电池续航方面的优势。

    相反,超低功耗架构应使设备仅保持执行特定任务所需的资源处于活动状态。

    轻量级传感和处理可以在高性能计算保持低功耗状态的同时运行。当某个事件需要更复杂的处理时,系统可以激活额外资源,执行相关任务,然后恢复到低功耗模式。

    这种分层方法对于可穿戴计算尤为重要,因为“始终在线”并不一定意味着必须以最高性能运行。

    在极低功耗下执行有用工作——并在需要时有选择地扩展计算能力——这一能力对于使连续智能在小型电池供电设备上得以实际应用至关重要。

    6. 综合评估硬件和软件

    只有当开发人员能够有效利用高效硅芯片的功能时,它才能创造价值。

    边缘AI部署不仅仅只是让神经网络运行起来那么简单。工程团队需要转换模型、针对资源受限的硬件进行优化、分析性能和内存使用情况、集成真实的传感器处理流程,并了解系统在哪些环节消耗能量。

    因此,应从一开始就将AI软件栈纳入芯片评估范围。

    Ambiq的 neuralSPOT® SDK 正是围绕这种软硬件关系设计的。它为在Apollo SoC上开发、部署、调优和分析AI模型提供了开源、实时且与操作系统无关的环境。

    对于工程团队而言,这有助于缩短从开发环境中运行的模型到在超低功耗终端上实现优化部署的流程。

    它还实现了边缘AI中日益重要的功能:协同优化

    开发人员无需分别对模型和芯片进行优化,而是可以评估模型架构、量化、内存利用率、处理资源以及运行模式在目标硬件上的相互作用。

    在空间极为受限的可穿戴设备中,这些交互方式至关重要。

    模型架构或内存行为的微小变化,对整体能耗的影响可能比AI峰值性能的显著提升更大。

    7. 选择一种能够随边缘AI扩展的架构

    可穿戴AI的需求正在迅速演变。

    今天的设备可能需要进行活动分类或关键词检测。明天的设备则可能将多种传感器与更强大的音频处理、计算机视觉、自然语言接口,或是功能日益强大的设备端AI模型相结合。

    这并不意味着每款产品都应从现有的最大AI加速器入手。这意味着底层平台需要留有扩展的空间。

    Ambiq 的投资组合体现了这一发展历程。

    Apollo SoC 为嵌入式和边缘 AI 工作负载提供了超低功耗的基础。 Apollo510 通过提供更高性能的处理能力,进一步扩展了这一能力,以满足日益复杂的AI需求,且在许多应用场景中无需配备专用神经网络处理单元(NPU)。

    对于那些能从大幅增强的专用神经处理能力中获益的工作负载,Ambiq即将推出的 Atomiq 系列在原有架构基础上进行了扩展,在保留SPOT作为其超低功耗基础的同时,新增了NPU加速功能。

    这为边缘AI计算创造了一个连续体,而非“一刀切”的方案。

    对于可穿戴设备设计师而言,这使得他们能够根据应用的实际需求来选择架构,而不是为了那些极少用到的性能,而自动承担相应的功耗和系统成本。

    比较可穿戴设备边缘AI芯片时应考虑的问题

    虽然技术规格有助于筛选候选产品,但在评估用于超低功耗可穿戴设备的边缘AI芯片时,产品和工程团队应超越这些规格进行考量。

    目的是了解在实际设备将面临的条件下,每种架构会表现如何。

    整个工作负载的能耗是多少?

    请向供应商索取包含以下方面的测量数据:感知、预处理、内存访问、AI推理、后处理以及运行状态之间的切换。

    令人印象深刻的加速器基准测试结果并不一定意味着可穿戴设备的整体功耗会降低。

    关键问题在于,整个应用程序在其实际工作周期内消耗了多少能量。

    该应用程序真的需要 NPU 吗?

    对于要求足够高的神经网络工作负载,NPU 可以发挥极高的效率。然而,在不需要的情况下添加或启用专用计算单元,可能会给系统带来不必要的复杂性。

    评估哪些工作负载可以在 CPU 或其他可用计算资源上高效运行,以及在哪些情况下专用神经网络处理能带来显著的性能或能效优势。

    对于可穿戴AI,其解决方案应取决于工作负载,而非规格表中是否列出了加速器。

    该架构在不同功耗状态之间的切换效率如何?

    可穿戴设备很少能持续以峰值性能运行。

    询问处理器在需要时能够多快、多高效地提升性能,以及在任务完成后能够多快、多高效地恢复到低功耗状态。

    对于始终处于开启状态的设备而言,这些状态转换过程中消耗的能量会影响整体电池容量。

    传输和存储数据需要消耗多少能量?

    AI 基准测试往往侧重于计算性能,却忽视了内存。

    询问模型权重、传感器数据和中间结果是如何在系统中流转的,以及高频使用的数据是否可以始终保持在需要它们的处理资源附近。

    随着模型规模的扩大,内存架构和数据传输可能会成为影响AI总能耗的日益重要的因素。

    开发人员能否在硬件上对实际模型进行测试和性能分析?

    与通用基准测试相比,具有代表性的工作负载能提供更有用的信息。

    工程团队应能够利用与目标产品相一致的模型和传感器管道,评估模型的延迟、内存利用率、计算利用率以及功耗表现。

    基准测试与最终应用越接近,其结果就越有意义。

    随着AI需求的变化,该平台能否实现扩展?

    如今的可穿戴设备可能需要进行传感器分类或关键词检测。未来的产品可能会增加多模态感知、更丰富的音频和视觉功能、自然语言界面,或更先进的设备端模型。

    请问该架构是否提供了一条切实可行的途径,既能提升AI性能,又不放弃当初使该设备得以实现的能效原则。

    这些问题综合起来,将比较的焦点从:

    哪款芯片的AI性能指标最高?

    收件人:

    哪种架构能最有效地运行我的应用程序?

    对于超低功耗的可穿戴AI而言,这种比较更具参考价值。

    选择AI芯片前应考虑的五个问题
    超低功耗边缘AI芯片应具备哪些特点 12

    测试实际工作负载,而不仅仅是基准测试

    技术规格表应有助于缩小潜在芯片的范围。最终的选择应根据实际工作负载来确定。

    在选择边缘AI平台之前,应使用具有代表性的模型、传感器输入、采样率、内存需求和运行模式对其进行测试。

    测量整个路径:

    感知 → 预处理 → 数据传输 → 推理 → 响应 → 休眠

    与单独测量推理延迟或加速器功耗相比,这能更真实地反映可穿戴设备的功耗情况。

    它还能揭示出数据表中无法显现的瓶颈。

    加速器可能以极高的效率运行神经网络,但预处理、内存传输或系统唤醒时间却占了总能耗的很大一部分。

    因此,最优秀的架构未必是那种在孤立的AI基准测试中获胜的架构。

    它能以最高效率处理完整的应用程序工作负载。

    真正的基准:在功耗预算内的智能

    下一代可穿戴设备不会仅由工程师能在手腕、手指、耳朵或身体上集成多少AI运算能力来定义。

    这将取决于它们在有限的能量条件下能提供多少有用的情报

    因此,在为超低功耗可穿戴设备选择边缘AI芯片时,系统总功耗、基于工作负载的计算、高效的内存迁移、持续感知、动态性能扩展以及软硬件协同优化都成为关键考量因素。

    Ambiq 从电源架构层面着手解决这一问题。

    SPOT平台 提供了超低功耗的基础。 Apollo 将这种效率带入可穿戴级边缘计算领域。 neuralSPOT 为开发者提供了针对该硬件构建和优化AI工作负载的工具。随着模型对专用AI性能的需求日益增长, Atomiq 将这一超低功耗理念延伸至基于NPU的架构中。

    对于可穿戴产品和工程团队而言,关键要点非常明确:

    不要一上来就问一款芯片能提供多少AI性能。应该从设备的能耗预算入手——并询问在该预算范围内,该架构能提供多少智能能力。

    对于始终在线、由电池供电的边缘AI而言,这才是真正重要的基准。

    订阅新闻通讯



      准备下载