AiNews
⚡ 速览 🧠 模型
← 返回首页

#hardware

包含标签 "hardware" 的文章,共 50 篇。

🎁 羊毛福利 Reddit

在NAS中部署移动端显卡运行大模型

Reddit LocalLLaMA 社区近期出现了一项硬件改造案例:开发者成功将 NVIDIA RTX A3000M 12GB 和 A2000M 等移动端工作站显卡装入 NAS 设备,并用于运行大语言模型推理。该方案利用拆机显卡与转接方案,在功耗和空间受限的 NAS 环境下实现了大显存推理。对于预算有限的开发者而言,这种非标准硬件架构为私有化 AI 部署提供了一条低成本、省空间的新路径。

🛠️ 开发工具 Hacker News

HungryGPU:本地大模型与硬件适配追踪工具

在本地运行开源大模型时,开发者常常面临显卡配置与模型版本不匹配、优化方案碎片化的问题。HungryGPU 是一个针对硬件环境的模型追踪与匹配工具,能够帮助用户根据自身显卡配置,快速检索并管理适合本地运行的 AI 模型、性能补丁和部署方案。该工具降低了本地大模型的硬件适配门槛,省去了繁琐的参数摸索过程,有效提升了本地 AI 开发的资源利用率和部署效率。

🧠 模型动态 V2EX

DeepSeek V4.1 Flash 部署讨论

开源社区近期热议 DeepSeek V4.1 Flash 模型。据透露,该模型参数规模达 485B,文件体积约为 510GB。硬件部署方面,常规配置下即使量化,也很难在两台 DGX Spark 上直接跑通。不过,该模型在架构上优化了 KV 缓存开销,单 token 占用降至原来的五分之一。经过适当量化并预留约 15GB KV 缓存空间后,使用四台 Spark 设备可以获得流畅的运行体验,这对关注本地部署和硬件成本的团队具有较高参考价值。

🧠 模型动态 Reddit

Qwen3.8 Flash Next 在 128GB Strix Halo 上的量化适配实践

在 128GB Strix Halo 平台上部署 Qwen3.8-Flash-Next-UD-Q5_K_XL 模型时,当同时跑语音识别、智能助手和语音合成等多模态服务,内存会直接压到极限。实测数据显示,mmproj 占用约 1GB;MTP 实际吃掉 5.5GB 内存,而其文件本身只有 2.8GB。此外,上下文长度和 KV 缓存量化对整体系统资源的消耗也十分明显。这些真实跑出来的内存数据,能为在消费级高性能硬件上部署多模态大模型的开发者提供直接的资源规划参考。

🎁 羊毛福利 Reddit

X570 与 X870 Taichi 主板双 GPU 配置解析

在 Linux 开发环境下,华擎 X570 Taichi 和 X870E Taichi 主板运行双 GPU 的核心在于 PCIe 通道分配。针对本地大模型推理、图形渲染和深度学习等高负载场景,主板需支持 x8/x8 通道拆分以保障双卡带宽。本文梳理了这两款 AM4 与 AM5 主板的 PCIe 实际规格、CPU 搭配方案及多卡协作要点,为硬件开发者提供实用参考。

🧠 模型动态 Hacker News

极小神经网络在单 Intel AMX 核心上跑出 6616 tok/s

这项研究展示了极小型神经网络在硬件层面的极致性能。通过针对 Intel AMX(高级矩阵扩展)指令集的专项优化,单个计算核心的推理吞吐量达到了每秒 6616 个 Token。该实践表明,结合轻量化架构设计与特定硬件加速,能大幅压榨边缘设备的算力潜力,为主流低功耗、低资源环境下的模型落地提供了切实可行的优化路径。

🧠 模型动态 V2EX

个人搭建本地大模型基座实践

分享一套低成本的个人私有 AI 基础设施搭建方案。硬件采用 48GB 内存迷你主机外接显卡坞,搭载 RTX 5070 Ti(16GB 显存),并借助 Claude 协助进行算力分配优化。模型方面部署了 qwen3.6-35,能够流畅支撑日常对话与各类应用调用。配合内网穿透与公网域名,实现了局域网与广域网环境下的 AI 能力随时接入,为个人开发者在应用层集成大模型提供了可行的落地参考。

🛠️ 开发工具 V2EX

一加 13 刷 OxygenOS 16 后气压计失效排查

在一加 13 国行版(PJZ110)刷入全球版 OxygenOS 16(CPH2653)并 Root 后,气压计出现失效,系统显示“不支持”。通过 dumpsys sensorservice 与 pm list features 排查发现,除气压计外,其余传感器均正常工作,但 SensorService 中缺失压力传感器服务。目前主要排查方向为国行硬件差异,还是跨版本刷机导致的底层驱动适配问题。此问题暴露出国内与海外固件在底层硬件配置上的潜在兼容差异。

🧠 模型动态 Hacker News

Z1T:面向概率硬件的稀疏Transformer模型

面向概率硬件的稀疏Transformer架构Z1T,旨在解决传统密集型模型在概率计算与不确定性任务中的效率瓶颈。该架构采用稀疏化设计贴合概率硬件特性,大幅降低了计算复杂度和资源消耗。通过算法与底层硬件的协同优化,Z1T为新型计算架构下的模型执行效率提供了新方案,也为底层AI架构优化、硬件加速及高效模型设计提供了实用的参考路径。

🎁 羊毛福利 Hacker News

AI算力采购的最大瓶颈:信贷与资金流动性

当前AI行业在扩张算力规模时,最大的卡点不再是硬件产能,而是信贷与资金流动性。随着大模型训练与推理成本不断飙升,动辄数亿美元的GPU采购需求让传统融资渠道显得捉襟见肘。由于AI基础设施建设具有高投入、长回报周期的特征,现有金融体系很难准确评估算力资产的风险。这种严重的信贷约束不仅拉长了供应链的资金周转周期,也让大量初创公司和中小算力服务商陷入了无米之炊的困境,直接制约了整个行业的发展速度。

💻 AI 编程 Hacker News

基于AI的后量子密码加速器设计与优化

面对量子计算对现有加密体系的威胁,高效实现后量子密码(PQC)硬件加速成为关键。针对晶格密码等算法计算复杂度高、存储需求大的痛点,传统手工设计效率低下。为此,引入机器学习模型驱动设计空间探索(DSE),在参数优化阶段平衡吞吐量、功耗与芯片面积。研究表明,AI技术能够有效辅助硬件描述语言生成与逻辑综合,显著缩短从密码算法到硬件的落地周期,提升资源受限环境下的运算效率,为构建抗量子基础设施提供可行路径。

🛠️ 开发工具 V2EX

东南亚外派求购二手国产安卓机:解锁与过检指南

东南亚银行目前已全面实装Bootloader锁检测,导致传统国行红米刷MIUI EU且不Root的方案在海外失效。当前的核心需求是在2026年9月前,寻找支持“解锁、刷国际版、回锁Bootloader”一条龙流程的国产机型。此举旨在避开海外版溢价,同时获取完整GMS与OTA更新,防止应用因缺失API崩溃,并顺利通过银行的安全环境检测。若国产机折腾成本过高,用户也将考虑转而购买国内易购的二手Pixel、三星或Moto等海外品牌。

🛠️ 开发工具 Hacker News

逆向 Meta Ray-Ban 眼镜以规避隐私风险

开发者对 Meta Ray-Ban 智能眼镜展开逆向工程,试图剥离内置的 Meta AI 隐私追踪功能。通过抓包与逆向分析,研究人员梳理了眼镜与手机 App 的私有通信协议,弄清了数据采集的触发机制。在技术实现上,通过修改本地网络请求和拦截 API 调用,阻止设备向 Meta 服务器回传环境音频、图像及用户行为数据。这起案例展示了封闭硬件生态下获取设备控制权的技术路径,同时也暴露出消费级 AI 硬件在隐私透明度上的隐患,为边缘计算与嵌入式安全分析提供了实操参考。

🛠️ 开发工具 Hacker News

OpenROAD 开源芯片设计工具链

OpenROAD 是一个开源的自动化数字芯片设计工具链,覆盖从 RTL 到 GDSII 的完整流程。该项目致力于提供快速、可预测的开源 EDA 解决方案,帮助开发者和研究人员摆脱对商业闭源工具的依赖,大幅缩短芯片设计周期。对于硬件开发者和开源社区来说,OpenROAD 降低了集成电路的设计门槛,为敏捷硬件开发和定制芯片创新提供了实用的基础设施。

🛠️ 开发工具 Hacker News

Rubato:复古Mac风格的AI编程状态桌面硬件

Rubato 是一款复古 Mac 造型的桌面硬件,搭载 ESP8266 芯片与 240x240 显示屏,通过呼吸气泡等动画实时显示 AI 编码状态。它兼容 DeepSeek Harness、opencode、OpenClaw、Claude Code 和 Cursor 等主流编程工具,并内置喝水、拉伸等健康提醒。该项目采用 Type-C 供电和 2.4G Wi-Fi 连接,硬件、固件与插件已全开源。开发者可以按开源资料自行组装,或直接在 Tindie 购买成品,将虚拟的 AI 运行状态转化为直观的桌面物理交互。

🧠 模型动态 Reddit

拥有 768GB 显存服务器,还能跑开源大模型吗?

一位开发者用 12 张 64GB 显存卡和 256GB 内存,组装了一台 768GB 显存的 EPYC 服务器。面对参数动辄突破 2 万亿的新一代开源大模型,这套硬件正面临淘汰压力。作者在社区发帖探讨:是继续砸钱追逐前沿大模型,还是精简 GPU 配置转向更小的 Flash 模型?这也引发了独立开发者如何应对硬件门槛飙升的广泛讨论。

🛠️ 开发工具 Reddit

本地硬件大模型推理吞吐量估算方法

在本地部署大语言模型时,如何准确估算每秒 Token 吞吐量?推理性能主要受内存带宽、模型大小和量化精度的直接影响。通过建立硬件规格与模型参数的数学模型,开发者无需实际跑分,就能在采购硬件或部署前预测推理表现。这有助于快速评估硬件性价比,优化本地 LLM 部署方案。

🛠️ 开发工具 Reddit

基于 NVIDIA PAIR 搭建个人 AI 计算集群

近期社区围绕 NVIDIA PAIR 展开讨论,聚焦于如何低成本构建私有 AI 计算集群。伴随本地大模型生态的成熟,开发者和极客正尝试将多台设备整合为高效的本地推理集群。这种方案不仅能满足复杂 AI 工作负载的运行需求,还能有效保障数据隐私,为主机算力拓展和私有化部署提供了切实可行的软硬件整合路径。

🧠 模型动态 Reddit

Qwen3.8-Flash-Next 在 Tesla T4 上的推理性能实测

开发者在 Dell R740 服务器(配备双 Xeon Gold 6230 CPU、384GB DDR4 内存及 Tesla T4 16GB GPU)上对 Qwen3.8-Flash-Next 模型进行了本地部署测试。该测试环境通过 Proxmox 虚拟化平台运行,并利用 ik_llama 优化推理效率。测试结果显示,在处理 256k 上下文长度的任务时,该配置实现了约 16 tok/s 的推理速度。相较于此前运行其他模型时仅 2 tok/s 的表现,Qwen3.8-Flash-Next 在有限的硬件资源下展现了显著的性能提升。此案例为在旧款企业级硬件上部署大参数量上下文模型提供了参考,验证了通过特定优化手段提升本地推理吞吐量的可行性。

🎁 羊毛福利 Reddit

开源大模型优化与硬件加速项目精选

盘点当前开源大语言模型生态中的推理优化与硬件加速项目。内容覆盖多层级内存管理方案(打通 VRAM、系统内存与硬盘协同推理)、推理引擎底层优化,以及降低开源模型部署门槛的实用工具与前沿进展,为资源受限环境下的高效推理提供技术参考。

🧠 模型动态 V2EX

GPT-6 技术演进与模型效率突破

OpenAI 的下一代技术路线正在引发开发者关注。核心讨论聚焦于架构与训练方法的创新,未来有望让 12B 或 27B 等本地小参数模型,实现数倍于自身体量的性能表现,逼近甚至达到更大规模模型的水平。这种技术趋势直接改变了社区对本地部署的预期,同时也对 Mac Studio 等硬件配置提出了新需求。一旦开源生态摸索并复现了这套路线,高质量 AI 推理的算力门槛将大幅降低,从而加速本地化 AI 应用的普及。

🛠️ 开发工具 V2EX

用大模型把旧安卓手机改造成 Linux 服务器

开发者借助大模型成功将闲置的小米 10 Pro 适配并运行 Linux 系统。在开发过程中,AI 不仅评估了骁龙 865(SM8250)芯片的 Linux 适配可行性,还协助完成了多日调试,最终顺利跑通主线内核,并攻克了 USB 供电等复杂的底层驱动难题。目前,该设备运行基于 Alpine Linux 的 postmarketOS,搭载 Linux 7.1.0 内核。这次实践验证了 AI 在底层硬件驱动开发和嵌入式 Linux 移植中的实用价值,也为废旧手机的二次开发提供了可行的技术路径。

📰 行业资讯 Hacker News

IFA 2026 前瞻:端侧 AI 与智能硬件落地风向

柏林 IFA 2026 消费电子展聚焦全球硬件、端侧 AI 与消费科技的最新进展。本届展会重点呈现智能化硬件在终端的集成落地,涵盖创新数码、智能家居及深度融合算法的计算设备。对开发者和创业者而言,IFA 2026 直观展示了硬件与 AI 的结合趋势,为边缘计算、物联网交互设计和新一代智能终端的软件开发提供了务实的市场参考。

🛠️ 开发工具 Reddit

双 RTX 5060 Ti 尝试启用 P2P 失败

开发者在运行 Qwen 27B 处理长文本时,遇到预填充阶段吞吐量骤降、导致聊天超时的瓶颈。在 Claude 协助下,他尝试借助开源的修改版 GPU 内核驱动,在两张 RTX 5060 Ti 上强开 P2P 通信。由于该非官方驱动仅适配 3090、4090 及 5090 等高端型号,5060 Ti 最终配置失败。这反映出中端消费级显卡在应对大模型长文本推理时,对高效卡间通信的迫切需求,以及非旗舰硬件在底层驱动修改上的局限。

🛠️ 开发工具 Hacker News

M4 Pro Mac mini 本地大模型搭建与性能调优

基于 M4 Pro Mac mini 搭建本地大模型的完整实操经验。充分利用 Apple Silicon 统一内存架构的高带宽优势,评估了大模型推理的实际吞吐量与响应速度。技术路线涵盖主流开源模型选型、llama.cpp 和 Ollama 等推理后端配置、模型量化方案以及本地开发环境集成。文中给出了针对 Mac 硬件的性能调优建议,为想要构建高性价比、低延迟且隐私安全的本地 AI 研发与测试环境的开发者提供了清晰的技术落地方案。

🧠 模型动态 Hacker News

DeepSeek-V3:底层硬件瓶颈与工程落地实战

深度剖析 DeepSeek-V3 在真实生产环境中的底层优化与工程落地细节。结合 Roofline 模型,重点拆解计算资源的高效利用方式、算力约束下的吞吐量提升策略,以及降低推理延迟的具体实现。文章跳出宏观概念,直击大模型在训练与推理环节的性能痛点,为一线开发者提供可复用的底层优化经验。

🎁 羊毛福利 V2EX

开发者社区热议本地部署大模型的硬件配置

V2EX社区近期围绕本地大模型运行硬件展开讨论。起因是一则闲置DDR5内存转让帖,引发开发者对内存带宽、容量及组装主机性价比的关注。随着开源模型与量化技术成熟,部分开发者仍有本地推理需求。讨论焦点集中在硬件成本、内存吞吐性能,以及与云端API调用的成本效益对比,折射出当前开发者在私有化AI部署中的硬件选型现状。

🧠 模型动态 V2EX

Mac本地跑大模型,真的划算吗?

针对 Mac 在 AI 时代具备硬件成本优势的说法,结合实际开发体验来看,本地部署的性价比并没有想象中高。从财务成本来看,以调用云端 API(如 DeepSeek V4 Flash)每天约 25 元的花费计算,购买 4 万元的高配 Mac(如 M5 Max 128GB),回本周期长达 4.4 年,这超过了电子产品 3 年的常规折旧期,属于典型的负投资。在开发体验上,云端 API 的推理速度和生成质量也明显优于本地量化的模型,后者常因速度慢和质量不稳定导致返工。虽然本地部署在数据隐私上有优势,但对日常开发者而言,综合成本、速度和质量后,直接调用云端 API 依然是更理性的选择。

🧠 模型动态 Hacker News

本地AI时代的终结与技术反思

本文探讨了本地部署大模型的发展现状与面临的严峻挑战。随着云端大模型在算力、上下文窗口和推理成本上的巨大优势,本地AI在实际开发和应用中的局限性日益凸显。文章分析了硬件瓶颈、开源模型生态与商业闭源模型之间的差距,并对未来开发者在本地化部署与云端调用之间的选择提供了技术视角与反思,引发了社区关于AI基础设施发展方向的讨论。

📰 行业资讯 Hacker News

SK海力士计划赴日本建厂以扩产HBM

SK海力士正评估在日本新建存储芯片厂的方案,以应对AI市场对高带宽存储器(HBM)的持续增长需求。随着AI服务器规模不断扩大,高性能存储芯片供应持续吃紧。此次建厂不仅能推进供应链的地域多元化,也将提升SK海力士在全球AI硬件基础设施中的产能支撑能力。

🛠️ 开发工具 Hacker News

开源社区为慧荣 SM750 GPU 编写全新 HDMI 驱动

开发者社区近期为慧荣科技(Silicon Motion)的 SM750 GPU 独立编写了一款全新的 HDMI 驱动。SM750 作为一款常见的低功耗显示芯片,长期面临官方驱动支持不足的问题,影响了其在现代设备上的显示适配。该开源驱动直接填补了厂商支持的空白,成功恢复并优化了该芯片的 HDMI 输出能力。这不仅降低了开发者对硬件的适配成本,也为嵌入式系统开发与老旧设备的二次利用提供了切实的工程实践参考。

📰 行业资讯 Hacker News

苹果因本地AI需求激增调整Mac产能

由于开发者和企业用户大量在本地运行大语言模型与AI Agent,搭载高性能处理器的Mac Mini和Mac Studio近期需求远超预期。AI本地化任务对算力与内存的高要求,正改变传统硬件的采购偏好。这一现象表明,AI开发正在从纯云端转向本地与云端协同的模式,直接推动硬件厂商重新评估产能分配与产品规划。

🛠️ 开发工具 V2EX

免费微信公众号短信推送方案选型

开发者在V2EX社区探讨如何将SIM卡接收器收到的短信,通过微信公众号或其他免费渠道实时推送到微信。这类物联网消息通知场景核心在于打通硬件与微信生态。对于独立开发者和硬件爱好者来说,选择稳定且免费的推送通道是降低成本的关键。目前可行的技术路径包括Server酱、Bark、企业微信应用消息以及微信客服接口等,能够满足低成本硬件提醒的集成需求。

🛠️ 开发工具 V2EX

微信消息推送方案选型与实现

V2EX 开发者热议免费微信消息推送方案。起因是有人购入 SIM 接收器硬件,希望将收到的短信实时推送到微信。这涉及软硬件消息通道的打通,开发者们围绕各类第三方推送服务、微信开发接口以及自建推送渠道展开了技术选型与实现细节的交流。

📰 行业资讯 Hacker News

Q-CTRL完成无GPS量子重力导航实地测试

Q-CTRL近日完成一项无GPS环境下的量子重力导航实地测试。该系统通过量子重力仪捕捉地球重力场的微小变化,实现高精度自主导航,彻底摆脱了对传统卫星定位的依赖。测试结果验证了量子传感技术在GPS信号受阻等复杂场景下的实用价值,为工业和防务领域的可靠导航提供了新方案。

📰 行业资讯 V2EX

Mac M5 Ultra 硬件推演与大模型推理性能分析

基于硬件参数推演,M5 Ultra 的显存带宽达到 1.2T,最高支持 256GB 统一内存,售价约 8.6 万元。其内存带宽约为 M3 Ultra 的 1.5 倍,官方预估 Prefill 性能可达其 4 倍。结合 omlx 框架的更新数据,本文对比了 M3 Ultra 与 M5 Ultra 在运行 ds-v4-flash-0731 模型时,在 1K 到 128K 不同上下文长度下的 Prefill 与 Decode 性能表现。这为本地部署大模型的开发者评估大容量统一内存的实际推理效率提供了参考。

🛠️ 开发工具 Hacker News

Claude 诊断并绕过 RTX 4090 显存故障

近期出现的一个硬件排查案例显示,大语言模型已具备处理底层技术问题的能力。面对一台出现故障的 RTX 4090 显卡,用户在 Claude 的协助下完成了故障诊断,精准定位到有缺陷的 VRAM 芯片。在此基础上,模型编写了针对性的软件补丁,通过修改内存映射成功绕过了硬件层面的缺陷,使显卡恢复正常运行。这一过程表明,AI 不仅能处理文本任务,在硬件调试和编写底层代码方面也展现出极高的实用价值。

🧠 模型动态 V2EX

M5 Ultra性能推演与本地大模型运行分析

基于苹果M5 Ultra芯片与256GB统一内存配置(1.2T显存带宽),结合omlx工具最新数据,推演其运行ds-v4-flash-0731等大模型的实际表现。M5 Ultra的内存带宽约为M3 Ultra的1.5倍,理论prefill性能可达M3 Ultra的4倍左右。通过估算不同上下文长度(1K至128K)下的prefill与decode性能,为本地部署大模型提供硬件性能参考。注:此为基于公开信息的数字推演,实际表现以官方实测为准。

🧠 模型动态 Reddit

Qwen4Exp架构:结合N-gram与MoE的参数卸载方案

Qwen4Exp架构通过引入N-gram模块,将部分模型参数卸载至SSD存储,改变了传统的纯MoE路线。核心思路在于利用MoE处理推理,而用N-gram承担信息召回。在不明显损失性能的前提下,该方案可将高达约25%的权重卸载到SSD。以176B模型为例,优化后转变为125B常驻RAM外加51B调用SSD的结构,显著降低了运行大模型对内存的硬件门槛。

🛠️ 开发工具 Hacker News

小米推出 AI Cube:实现 1.22 TB/s 近存带宽优化大模型

小米推出全新的 AI Cube 硬件架构,主打近存计算技术,旨在突破本地运行大语言模型的内存带宽瓶颈。该方案的内存带宽达到 1.22 TB/s,能有效减少处理器与内存间的数据传输延迟和功耗,大幅提升模型推理的吞吐量与响应速度。通过这项技术,更大参数规模的模型可以直接在本地流畅运行,减少对云端算力的依赖。对于开发者而言,AI Cube 为边缘侧 AI 应用提供了更强悍的硬件底座,在构建本地 AI Agent 或隐私敏感型应用时,既能保证数据不出本地的安全性,又能获得接近云端的推理性能。

🧠 模型动态 V2EX

Mac M5 Ultra 运行大模型性能推演

基于硬件参数推演,M5 Ultra 芯片搭配 256GB 统一内存的 Mac 方案,其内存带宽可达 1.2TB/s,在预填充阶段相比前代有明显提升。结合 omlx 框架的更新数据,本文测算并对比了该配置在运行 ds-v4-flash-0731 Q4 等模型时,在不同上下文长度下的预填充与解码性能,为本地大模型开发评估算力基础。

🧠 模型动态 Reddit

RTX 5090 与 3090 运行 Qwen3.8-Flash-Next 实测

在 RTX 5090 与 RTX 3090 双卡异构环境下,成功部署 Qwen3.8-Flash-Next(125B MoE 架构,6B 激活参数,48层)。实验采用 unsloth UD-Q4_K_XL GGUF 量化版本,模型体积约 111 GB。通过基于 llama.cpp 分支构建的服务端,修复了图节点预算、量化 KV 缓存及回滚支持等兼容性问题。最终在双卡环境下跑出了约 30 token/s 的推理速度,为在消费级硬件上部署大规模 MoE 模型提供了可行的性能参考。

🛠️ 开发工具 Reddit

Strix Halo 与 R9700 性能实测对比

开发者分享了 128GB 内存配置的 Strix Halo 开发板与 R9700 Pro AI卡的实机使用体验。结合个人 Linux 机器的配置过程,实测了这两款硬件在本地 AI 负载和日常计算任务中的运行表现。内容直击本地推理与边缘计算场景,为硬件选型提供真实的性能参考。

🎁 羊毛福利 Reddit

预算硬件自托管大模型实践指南

基于多路 RTX 3060 12GB、Intel Arc Pro B60 24GB、RX 9070 XT 等经济型硬件,分享大模型本地部署的实操经验。内容覆盖硬件选型、推理优化、基准测试以及前端交互工具四大方向,系统梳理了低成本环境下的技术方案与性能调优策略,为预算有限的开发者提供切实可行的落地参考。

🧠 模型动态 Hacker News

Axera AX8850 运行 GGUF 模型实践

在边缘端 AI 处理器 Axera AX8850 上运行 GGUF 格式大语言模型。通过对 GGUF 格式的支持,开发者可以在资源受限的嵌入式设备中高效加载与运行量化模型,降低边缘侧部署门槛。该实践展示了国产边缘 AI 硬件对主流开源模型生态的适配能力,为物联网设备的端侧大模型落地提供参考。

🛠️ 开发工具 V2EX

Mac M5 Ultra 硬件推演与模型运行性能分析

结合苹果官方数据与 omlx 框架更新,对搭载 M5 Ultra 芯片的 Mac 进行性能推演。该硬件最高支持 256GB 统一内存,显存带宽达到 1.2TB/s。在运行 ds-v4-flash-0731 等大语言模型时,其 prefill 性能约为 M3 Ultra 的 4 倍,内存带宽提升近 50%。在 1K 到 128K 的不同上下文长度测试中,无论 prefill 还是 decode 阶段,吞吐量和处理速度均有大幅改善。这为本地部署大模型和高内存端侧设备的开发者提供了实际性能参考。

🛠️ 开发工具 V2EX

Mac M5 Ultra 硬件性能推演与大模型运行评估

本文基于对 Mac M5 Ultra 硬件规格的数字推演,探讨了其在运行大语言模型(如 ds-v4-flash-0731)时的潜在性能表现。M5 Ultra 具备 1.2T 显存带宽与 256GB 统一内存版本(售价 8.6 万元),其内存带宽约为 M3 Ultra 的 1.5 倍。结合 omlx 等框架的官方性能数据进行推算,M5 Ultra 在不同上下文长度下的 prefill(预填充)性能和 decode(解码)吞吐量较前代有显著提升。该推演为本地部署大规模参数量模型的开发者和硬件选型提供了参考依据,展示了苹果硬件在边缘端或本地大模型推理场景中的实际应用潜力。

🧠 模型动态 V2EX

Mac M5 Ultra 运行大模型性能推演

基于 Apple 官方数据与 omlx 框架更新记录,推演配备 256GB 统一内存的 Mac M5 Ultra 运行大语言模型(如 ds-v4-flash-0731)的实际性能。M5 Ultra 的内存带宽达到 1.2TB/s,Prefill 性能约为 M3 Ultra 的 4 倍。通过量化对比 1K 到 128K 不同上下文长度下的 Prefill 吞吐量与 Decode 解码速度,为本地部署大模型的硬件选型提供数据参考。

📰 行业资讯 V2EX

OpenAI 正在设计 Jalapeño 定制芯片

行业讨论显示,OpenAI 近期流片了一款代号为 Jalapeño 的定制芯片,其推理性能和能效比表现亮眼。该芯片的研发过程得到了 GPT-6 模型的辅助,标志着 AI 生成式设计进入实际应用阶段。这一进展引发了开发者对底层硬件与大模型协同设计的关注,自研芯片正成为降低推理成本和提升系统效率的关键路径。