開發內容與工作範圍
以下工作可根據現有系統和專案條件組合實施,具體模組與交付責任在專案範圍中確認。
平臺與資源評估
核對目標晶片、板卡、SDK、介面、供貨和驗收條件,確認可實施範圍與關鍵風險。
硬體方案與載板開發
按照參考資料和目標外設開展電源、儲存、網路、顯示、攝像頭及擴充套件介面設計。
BSP 與嵌入式系統
圍繞可取得的 SDK 開展啟動、核心、裝置樹、檔案系統、系統服務、升級和日誌開發。
驅動與外設整合
結合原理圖、介面時序和器件資料完成驅動、配置及業務介面聯調。
應用與整機驗證
整合裝置管理、資料處理和業務程式,並在約定樣機上驗證功能、資源與持續執行。
版本交付與匯入支援
交付約定範圍的設計、原始碼或補丁、韌體、構建燒錄說明和測試記錄。
昇騰910存量訓練平臺服務包括什麼?
該服務面向採用昇騰910處理器相關Atlas訓練伺服器或訓練卡的既有環境,覆蓋硬體與軟體基線識別、CANN 910運算元環境、MindSpore或PyTorch外掛適配、單卡與多卡訓練、HCCL通訊排障、效能分析、推理複用及遷移評估。具體能力取決於伺服器型號、NPU拓撲、CPU架構、作業系統、驅動韌體和框架版本。
昇騰910與Atlas A2/A3訓練系列具有不同的產品和軟體配套關係。存量專案將優先保護現有可執行環境、訓練程式碼、權重和配置,再根據維護週期、升級條件和目標平臺確定後續路線。
適用專案
以下場景可進入評估;具體工作包以目標硬體、資料和驗收條件為準。
- 現有Atlas訓練伺服器環境無法復現、升級失敗或依賴衝突
- PyTorch或MindSpore訓練任務需要適配裝置、混合精度或運算元
- 單卡可執行但多卡任務存在HCCL、拓撲、超時或效能問題
- 訓練結果、損失曲線或檢查點在遷移後出現差異
- 需要把訓練模型用於目標裝置推理並建立轉換、驗證流程
- 計劃遷移到Atlas A2系列,需要評估程式碼、運算元、並行和運維差異
昇騰910存量訓練平臺服務內容
每項服務在啟動前確認輸入資料、版本基線、交付成果、驗收方法和範圍邊界。
01 · 訓練環境梳理與恢復
記錄伺服器、NPU拓撲、OS、驅動韌體、CANN、運算元包、框架、Python和依賴,建立可復現環境。
02 · 訓練程式碼適配
處理裝置遷移、資料載入、混合精度、最佳化器、運算元、檢查點和隨機性控制問題。
03 · 單卡與多卡驗證
從最小批次開始驗證單卡,再按約定拓撲檢查HCCL、程序啟動、通訊和容錯。
04 · 精度與收斂排查
對比輸入、權重、運算元、精度模式、損失、梯度和檢查點,記錄差異來源。
05 · 效能分析
使用可用工具定位資料、CPU、NPU、通訊、運算元和I/O瓶頸,形成前後對比證據。
06 · 升級與A2遷移評估
對比CANN運算元包、框架API、並行策略、模型資產和叢集運維,驗證關鍵阻塞項。
專案評估需要的輸入
建議在專案啟動前準備以下資料;如部分資料暫缺,可先完成環境梳理和關鍵功能驗證。
- Atlas伺服器或訓練卡具體型號、NPU拓撲和CPU架構
- 作業系統、驅動、韌體、CANN 910運算元包和框架版本
- 訓練程式碼、依賴鎖定、啟動指令碼和配置
- 資料集結構、樣本範圍、資料授權和基準結果
- 單卡或多卡日誌、效能取樣和故障復現
- 目標訓練規模、驗收指標、執行視窗和遷移計劃
實施路徑
保護基線
備份環境、程式碼、配置、權重和正常執行證據。
最小訓練閉環
在單卡小資料集驗證前向、反向、儲存和恢復。
擴充套件與最佳化
逐步擴充套件多卡和資料規模,定位通訊、運算元與資源瓶頸。
迴歸與交付
按固定指令碼複測精度、穩定性、效能和恢復流程。
交付物與驗收邊界
在窄屏裝置上可左右滑動,使用鍵盤時可按左右方向鍵檢視完整表格。
| 工作包 | 主要交付物 | 驗收依據 | 範圍邊界 |
|---|---|---|---|
| 環境工程 | 安裝配置、依賴鎖定、容器或指令碼、版本清單 | 乾淨基線能啟動約定訓練任務 | 硬體故障和歷史軟體包獲取條件另行確認 |
| 訓練適配 | 程式碼補丁、配置、啟動指令碼和檢查點說明 | 約定資料、輪次和精度口徑完成迴歸 | 訓練結論適用於已授權資料和約定訓練範圍 |
| 多卡與效能 | 拓撲記錄、通訊配置、Profiling與對比報告 | 約定卡數和指令碼下任務穩定完成 | 測試結論適用於約定拓撲和叢集規模 |
相容性、許可與責任邊界
需另行約定的內容
- 多機規模評估所需的伺服器型號與拓撲資訊
- 資料集處理所需的合法授權及來源資訊
- 完整訓練收斂評估所需的資料規模與執行週期
- 合同之外的機房、網路、儲存、排程平臺及硬體維保總包
常見問題
昇騰910和910B環境相同嗎?
兩類平臺使用不同的運算元包標識,還需結合具體產品系列、硬體配置和軟體版本分別確認。
可以遷移PyTorch訓練嗎?
可以評估torch_npu路線,並檢查框架版本、API、運算元、資料、精度模式和訓練指令碼。
多卡問題通常與哪些因素有關?
除HCCL外,還可能與拓撲、網路、程序啟動、資料載入、超時、驅動或資源配置有關。
怎樣驗證訓練精度?
固定程式碼、權重、種子、資料子集和精度模式,比較損失、關鍵指標、梯度或檢查點,並記錄允許誤差。
可以開展模型推理部署嗎?
可以將訓練產物按目標推理裝置和框架進行評估,並單獨完成模型轉換、應用和驗收。
升級後的效能如何確認?
升級前後使用相同指令碼、資料、硬體和計時口徑進行測試,並形成對比報告。
如何處理正在執行的訓練環境?
先保留映象、軟體包、配置、權重和日誌,再在隔離節點驗證;生產切換需單獨確認審批和回滾方案。
需要提供全量資料嗎?
初期可使用具有代表性的授權樣本開展適配;最終收斂驗收所需資料範圍由專案合同及技術附件確定。
官方資料與版本依據
下列連結用於確認產品形態和軟體配套;正式專案仍以雙方凍結版本的官方資料為準。
服務與驗收說明
本頁說明可討論的工程服務範圍,不構成對固定效能、週期、價格、認證、審批或業務結果的承諾;最終範圍以目標環境、輸入資料及雙方確認的技術和商務檔案為準。
線上諮詢
電話諮詢
微信諮詢

回到頂部