AI寫程式快41%卻多出錯?程式審查淪為「綠色勾勾」形式,誰來為機器人程式碼負責?

工程團隊導入AI程式工具之後,速度圖表確實亮眼,Pull Request(PR)的規模跟數量同步放大,但怎麼事…

12 分鐘

Read Time

工程團隊導入AI程式工具之後,速度圖表確實亮眼,Pull Request(PR)的規模跟數量同步放大,但怎麼事故通報也跟著悄悄攀升了?這不是工具本身的問題,而是瓶頸轉移了,組織根本沒跟上。

CodeROI技術長Anna Meadows在《富比士》專欄點出一個殘酷現實:過去軟體開發最燒錢的環節是寫程式碼,現在最燒錢的,變成了判斷產出的程式到底正不正確、安不安全、值不值得維護個五年。這道工序叫做驗證(verification),但多數企業還是把它當成附加流程,可有可無。

AI加速寫code,審查卻卡在人力瓶頸

AI讓進入審查的程式量呈倍數成長,審查人力卻沒有增加。審查者只能略讀、核准、然後相信那個綠色勾勾。說真的,這不叫審查,這叫盲猜。

根據一份針對約800名開發者的研究顯示,使用AI程式助理的工程師,生產出來的程式錯誤率高出41%,整體效率卻沒有明顯提升。速度變快了,但錯誤更多,修bug的時間把省下來的時間又吃回去了,這算哪門子的效率?

「AI寫程式失敗的方式跟人類不太一樣。它很少顯得草率,反而非常自信、符合慣例、結構完整,但商業邏輯可能藏著細微偏差,而一般的程式檢查工具(linter)根本抓不到。」

換句話說,AI不會寫出明顯的爛code,它會寫出看起來很專業、但關鍵邏輯有問題的code。這種錯誤最可怕,因為它藏在看起來沒問題的程式碼裡,等你發現的時候,可能已經上線好幾個月了。

驗證是系統工程,不是憑感覺抓bug

Meadows直言,當程式審查變成形式化的流程,成本只是延後支付而已。最終這些成本會以事故、重工、還有一堆沒人看得懂的程式庫來回收。那該怎麼辦?她提出三個具體方向:

  • 把信任從「閱讀」轉為「檢查」:用類型系統、合約測試、屬性測試、靜態分析這些確定性關卡來承擔前幾輪的把關。人類應該是最後一道防線,而不是唯一的防線。
  • 讓測試成為規格:工程師事先撰寫或核可的測試套件,才是人類意圖的真正所在。不是AI寫完你再來想怎麼測,而是先想好怎麼測,再讓AI去寫。
  • 審查當成稀缺資源來分級:相依套件升版跟計費邏輯變更,不應該走同一條審查路徑。高風險的變更需要更多資源投入,這很基本,但很多團隊沒在分。

「生產的問題已經解決了,但驗證還沒有。」Meadows說得很直接。無法信任的速度,不是速度,而是延後引爆的風險。

誰為AI寫的code負責?組織問責機制還在睡

另一個更根本的問題是組織層面的。AI寫的程式,出了事誰負責?

答案應該是把程式碼合併進主幹的那個人。但前提是流程有留下完整紀錄:哪些部分是AI產生的、哪些被人類修改過、經過哪些檢查、最後是誰拍板定案。問題是,多數公司的工程脈絡還停留在聊天串跟個人記憶裡,幾個禮拜後就消散了,事後要稽核或追責時,只能兩手一攤。

Meadows特別提醒,程式來源履歷正從工程問題升級為法規與財務問題。監管機關、保險業者、併購方、稅務單位,都開始要求舉證了。這不是未來式,是進行式。

她建議,先挑一個高風險區塊建立驗證路徑:產生程式之前先寫好必要測試、導入自動化政策檢查、然後為每次合併指定明確的負責人。不用一次全部到位,但至少先從最痛的地方開始。

程式審查不是附加流程,是品質的最後防線

回頭看整個問題的核心:AI寫程式解決了「產出」的問題,但「判斷」的問題被嚴重低估了。過去我們花大部分力氣在寫code,現在我們得花大部分力氣在確認code是對的。這個轉變,很多組織還沒意識到,更別說應對。

從產業面來看,接下來幾年會出現兩個明顯的趨勢:第一,驗證工具鏈會變成新的戰場,誰能提供更好的靜態分析、合約測試、政策檢查工具,誰就能在AI開發工具市場佔到位置。第二,組織流程會被迫重組,那些還把審查當成「附加流程」的公司,會開始頻繁出事故,然後被市場淘汰。

對工程團隊來說,現在該問自己的不是「我們要不要用AI寫程式」,而是「我們的驗證流程準備好了嗎」。如果答案是否定的,那速度越快,風險越大。

編輯觀點
Anna Meadows這篇專欄點出了一個很關鍵的盲區。過去一年大家都在瘋AI寫程式的生產力提升,但很少有人認真問:產出的品質怎麼把關?其實這問題跟自動化生產線有點像,機器速度快了,品檢環節跟不上,瑕疵品就會流到市場。軟體開發更麻煩,因為瑕疵不會立刻被看到,可能幾個月後才爆炸。對一般企業來說,與其急著把AI塞進開發流程,不如先花時間把驗證機制建好。速度從來就不是問題,問題是你敢不敢信任那個速度。

最後,給正在導入AI程式工具的團隊一個誠懇的建議:先把驗證流程畫出來,再決定AI要放在哪個環節。不要等到事故發生了才回頭補救,那時候付出的成本,絕對比一開始慢慢建來得高。檢視一下你們的PR審查流程,問問自己:那個綠色勾勾,你真的信任嗎?

本文改寫整理自公開新聞來源,原始報導由科技新報發布。

常見問題 FAQ

AI寫程式的錯誤率真的比人類高41%嗎?

是的。根據一份針對約800名開發者的研究數據顯示,使用AI程式助理的工程師產出的程式錯誤率確實高出41%。不過這不代表AI比較差,而是人類在審查AI產出的程式時,容易因為看起來很專業而放鬆戒心,導致錯誤被忽略。

什麼是程式驗證?為什麼它比寫程式還重要?

程式驗證(verification)是確認產出的程式是否正確、安全、值得長期維護的過程。在AI時代,寫程式的成本大幅下降,但判斷程式品質的成本反而上升。如果驗證沒做好,錯誤會以事故、重工的形式「延後支付」,代價往往更大。

AI寫的程式出錯,誰該負責?

負責人應該是將程式碼合併進主幹的審查者,而不是AI工具本身。前提是團隊必須建立完整的紀錄機制,包含哪些部分由AI產生、經過哪些檢查、誰最終批准。隨著監管要求提高,程式來源履歷將成為法規與稽核的焦點。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。

About the Author

AF themes

Easy WordPress Websites Builder: Versatile Demos for Blogs, News, eCommerce and More – One-Click Import, No Coding! 1000+ Ready-made Templates for Stunning Newspaper, Magazine, Blog, and Publishing Websites.

BlockSpare — News, Magazine and Blog Addons for (Gutenberg) Block Editor

Search the Archives

Access over the years of investigative journalism and breaking reports