Discover your interests, together

Real deals, honest reviews and shopping stories from people who share your interests — every day on Milik.

Discover your interests, togetherReal deals, honest reviews and shopping stories from people who share your interests — every day on Milik.

Mengapa Projek AI Berskala Besar Gagal di Organisasi

Mengapa Projek AI Berskala Besar Gagal di Organisasi
Interest|AI Practical Tips

Masalah Sebenar Implementasi AI Enterprise, Bukan Sekadar Model

Implementasi AI enterprise merujuk kepada penggunaan sistem berasaskan AI untuk menyokong proses perniagaan kritikal, seperti sistem rekomendasi skala besar, moderasi AI otomatis, dan automasi kerja pengetahuan, yang memerlukan bukan sahaja model pintar tetapi juga pengurusan maklumat, infrastruktur boleh dipercayai dan penjajaran rapat dengan matlamat perniagaan yang jelas. Organisasi yang tergesa-gesa mengguna pakai model generatif sering mengulangi kesilapan yang sama: melebihkan kepentingan model dan mengabaikan konteks, retrieval, dan cara sistem digunakan sehari-hari. Pengalaman sedekad membina sistem rekomendasi dan personalisasi menunjukkan bahawa model hanyalah sebahagian kecil daripada keseluruhan mesin kecerdasan. Di Amazon, meningkatkan cadangan tidak selesai dengan menukar algoritma; ia memerlukan kefahaman tingkah laku pelanggan yang berubah, isyarat yang sentiasa terkini, eksperimen dengan pengguna sebenar dan operasi sistem sokongan yang stabil. Apabila organisasi mengabaikan perkara ini, projek AI mudah kekal sebagai demo yang cantik tetapi tidak memberi kesan perniagaan.

Kesilapan berulang yang paling ketara ialah obsesi menaik taraf model sedangkan isu utama datang daripada retrieval dan kualiti maklumat. Maklumat boleh tepat pada masa ia dijana, namun menjadi punca keputusan salah apabila konteks berubah atau data tidak dikemas kini. Lebih berbahaya, jawapan AI yang silap sering disalin ke tiket, dokumen atau pangkalan pengetahuan dan kemudian diambil semula oleh sistem lain sebagai "bukti" yang dipercayai. Inilah lingkaran kesilapan yang memusnahkan kebolehpercayaan perusahaan. Pengurus yang mengukur kejayaan melalui skor benchmark model juga terlepas satu hakikat: apa yang penting ialah apa yang berlaku bila manusia menggunakan sistem tersebut dalam kerja sebenar, bukan angka di makmal. Tanpa metrik yang mengukur keputusan perniagaan, sebarang peningkatan model hanyalah kosmetik teknikal yang tidak menjawab masalah pelanggan.

Pelajaran Amazon: Reka Sistem, Bukan Kejar Skor Model

Sistem rekomendasi skala besar yang berjaya jarang bergantung pada satu model serba boleh. Platform carian dan rekomendasi yang matang biasanya mengecilkan katalog besar kepada set calon yang berguna, kemudian barulah menggunakan logik pemeringkatan yang lebih mahal dan kompleks. Pendekatan bertahap ini bukan sekadar pilihan teknikal; ia adalah prinsip reka bentuk yang memastikan sistem kekal pantas, boleh dijelaskan dan sejajar dengan matlamat perniagaan. Pengalaman sedekad membina rangka kerja carian dan rekomendasi menunjukkan bahawa kejayaan datang apabila pasukan menumpukan perhatian kepada konteks pengguna, isyarat yang relevan dan cara sistem berinteraksi dengan proses lain, bukannya hanya mencari model terkini. Sistem sebegini juga perlu belajar daripada maklum balas tidak sempurna dan terus berfungsi apabila sebahagian komponen gagal, bukan tumbang sepenuhnya kerana satu perkhidmatan bermasalah.

Di Amazon, pasukan yang mengurus sistem rekomendasi belajar bahawa peningkatan sebenar berlaku apabila mereka bertanya: apa yang sistem sembunyikan, isyarat apa yang digunakan, bagaimana tingkah laku pelanggan berubah selepas rekomendasi, dan apa yang terjadi bila kebergantungan tertentu gagal. Soalan-soalan ini memaksa pasukan melihat melangkaui ketepatan model kepada dinamika operasi dan kesan terhadap pengguna. Prinsip yang sama patut dibawa ke dalam implementasi AI enterprise moden: yang diurus bukan sekadar model, tetapi keseluruhan keputusan atau proses perniagaan yang dipengaruhi oleh model tersebut. AI yang boleh dipercayai mesti jelas tentang sumber maklumat, melindungi data sensitif dan tahu bila perlu meminta penjelasan atau melibatkan manusia. Tanpa lapisan tadbir urus ini, organisasi berisiko membina mesin automasi yang tampak canggih tetapi mengukuhkan kesilapan dan bias sedia ada.

DoorDash: Moderasi AI Otomatis Bukan Sekadar "Letak LLM"

Kisah SafeChat di DoorDash ialah contoh klasik bagaimana naluri "letak LLM" boleh membawa kepada reka bentuk sistem yang tidak realistik. DoorDash mengendalikan lebih 4 juta mesej chat setiap hari, 400,000 panggilan antara pengguna dan penghantar, serta 200,000 imej melalui chat atau SMS. Untuk chat, sasaran mereka jelas: setiap mesej yang sampai ke destinasi mesti diklasifikasikan sebagai selamat oleh sistem. Pada mulanya, cadangan perniagaan ialah memanggil LLM bagi setiap mesej untuk menyatakan selamat atau tidak, kemudian menyekat jika perlu. Secara teori, ini nampak mudah; secara praktikal, kependaman 2 hingga 10 saat bagi setiap panggilan LLM dan kos pemanggilan berjuta-juta kali sehari menjadikannya mustahil untuk skala produksi masa nyata. Jika pasukan tunduk kepada cadangan awal itu, pengalaman pengguna akan rosak dan bil operasi akan melambung.

Pasukan DoorDash memilih jalan yang lebih berdisiplin: berhenti membuat keputusan, dan luangkan beberapa bulan untuk faham data terlebih dahulu. Mereka menginstrumentasi chat dan menggunakan API moderasi percuma secara asynchronous bagi mengesan kategori mesej tidak selamat. Analisis tersebut mengesahkan jangkaan mereka namun menambah satu butiran penting: hanya peratusan satu digit kecil mesej didapati tidak selamat. "Only a small single-digit percent of messages were unsafe". Angka ini membentuk keseluruhan seni bina SafeChat. Mereka membina pengelas kecil di rumah, dilatih atas data tadi, dengan tiga tugas: pantas (jawapan di bawah 100 milisaat pada 90%), murah (tiada kos per panggilan, hanya infrastruktur sendiri) dan pakar dalam satu perkara – mengenal pasti mesej yang jelas selamat. Mesej yang gagal dilabel selamat oleh lapisan agresif dan murah ini, kurang daripada 10%, barulah diperiksa oleh LLM. Hasilnya, mereka mencapai sekitar 50% pengurangan insiden berkaitan penyalahgunaan verbal – pengurangan sebenar dalam mudarat manusia, bukan sekadar peningkatan ketepatan model.

Daripada SafeChat ke Platform Moderasi Content-Agnostic

Selepas SafeChat berjaya menurunkan insiden keselamatan dan membuktikan pola hibrid ini berkesan, pasukan DoorDash berdepan permintaan baru daripada pasukan lain: mereka mahu sistem serupa untuk pelbagai kes penggunaan keselamatan dan kandungan lain. Jika setiap permintaan dipenuhi dengan membina sistem baru dari kosong, organisasi akan mengulang kerja tanpa henti. Pasukan menyedari bahawa apa yang rakan-rakan mereka mahukan bukan SafeChat sebagai produk spesifik, tetapi pola seni bina yang SafeChat jelaskan. Daripada membiarkan pola itu terperangkap dalam satu aplikasi, mereka menukarnya menjadi platform moderasi AI otomatis yang content-agnostic. Idea utama: platform tidak perlu tahu apa maksud kandungan atau logik perniagaan tepat untuk setiap pasukan; yang penting ialah kebolehan melog keputusan, berintegrasi dengan pelbagai penyedia model dan menukar strategi pengambilan keputusan tanpa memecahkan aliran kerja.

Pendekatan content-agnostic ini ialah pelajaran bernilai bagi mana-mana organisasi yang cuba menskala implementasi AI enterprise. Daripada membenarkan setiap pasukan mengulang kesilapan reka bentuk sendiri, organisasi boleh membina platform terpusat dengan pola hibrid: model dalaman yang pantas dan murah untuk kes biasa, diikuti model generatif atau LLM untuk kes sukar dan ambiguiti. Dengan cara ini, moderasi AI otomatis menjadi lapisan infrastruktur yang boleh dikongsi, bukan projek ad hoc setiap kali tim produk memerlukan klasifikasi kandungan. Ia juga memudahkan tadbir urus: log keputusan, audit laluan pengambilan keputusan, dan kawal data sensitif dari satu tempat. Pelajaran halus di sini ialah pentingnya memisahkan logik perniagaan (siapa patut disekat, bila) daripada enjin moderasi (bagaimana kandungan dinilai), supaya organisasi boleh menukar model dan pembekal tanpa mengganggu pengalaman pengguna.

LinkedIn: Multi-Agent AI Deployment Mengatasi Had Reviewer Tunggal

Di skala LinkedIn, bergantung semata-mata kepada reviewer manusia atau AI off-the-shelf yang dipasang di depan sistem pengurusan kod bukan cara berkesan untuk mengurus pull request. Masalahnya bukan sekadar jumlah PR, tetapi kualiti maklum balas yang pembangun sanggup ambil tindakan. Menjana komen review AI dalam jumlah besar adalah perkara remeh; kesukaran sebenar datang selepas itu: memastikan komen tersebut berpijak pada diff sebenar, tidak berhalusinasi, kaya isyarat bukan bising, dan khusus kepada piawaian serta konvensyen kod dalaman, bukannya nasihat generik. Tambahan pula, ulasan mesti tiba sebelum reviewer manusia, bukan selepas mereka selesai kerja. Off-the-shelf reviewer cenderung mempunyai tiga masalah struktur: titik buta disebabkan penggunaan model tunggal, penyesuaian terhad menangkap konvensyen repositori dan senario berisiko tinggi, serta kekurangan kawalan operasi sebagai sebahagian infrastuktur kejuruteraan.

Bagi menangani ini, jurutera LinkedIn membina platform ulasan kod berasaskan multi-agent AI deployment, terdiri daripada beberapa reviewer AI bebas yang menggunakan model dan pendekatan penaakulan berbeza. Reka bentuk multi-agent membolehkan silang-pengesahan antara reviewer dan meningkatkan keyakinan kepada dapatan. Pada masa yang sama, mereka menambah lapisan penyesuaian mendalam dan boleh digubah merentasi tiga tahap: dasar organisasi, konvensyen per-repositori dan peraturan konteks untuk senario berisiko tinggi atau berimpak besar. Platform ini juga dilayan sebagai infrastuktur produksi dengan seni bina berasaskan Kubernetes yang menyokong pipeline beracara peristiwa, queue tahan lasak dan penskalaan mendatar. Dalam penilaian ke atas 5,230 komen review yang diambil sampel merentasi 1,727 PR, 90.1% boleh dinilai dengan keyakinan tinggi berdasarkan kod yang telah digabungkan, dan 63.9% cadangan diterima – termasuk 80% ralat logik dan 100% bug concurrency. Ini menunjukkan bahawa dengan reka bentuk sistem yang betul, ulasan kod AI boleh mengurangkan bising dan menambah nilai nyata kepada pembangun.

Tiga Prinsip Untuk Elak Kegagalan AI Enterprise

Pengalaman Amazon, DoorDash dan LinkedIn memancarkan tiga prinsip jelas untuk organisasi yang mahu mengelak daripada mengulang kegagalan AI enterprise. Pertama, jangan anggap setiap masalah memerlukan model baru; fokus kepada sistem sekeliling – retrieval, konteks, maklum balas pengguna dan kebergantungan. Kedua, gunakan pola hibrid yang menggabungkan lapisan pantas dan murah dengan model generatif yang lebih berat, seperti yang dilakukan oleh DoorDash dalam SafeChat dan diteruskan dalam platform moderasi content-agnostic mereka. Ketiga, elakkan bergantung kepada satu model atau satu agen untuk tugas kompleks berskala besar; gunakan multi-agent AI deployment dengan penyesuaian mendalam dan kawalan operasi seperti pendekatan ulasan kod LinkedIn. Di bawah semua ini, ada satu prinsip menyeluruh: ukur kejayaan berdasarkan pengurangan mudarat manusia dan peningkatan hasil perniagaan, bukan sekadar skor ketepatan atau benchmark teknikal.

Untuk pasukan AI enterprise, pelajaran paling penting ialah berhenti melihat AI sebagai alat ajaib dan mula melihatnya sebagai komponen dalam sistem keputusan yang lebih besar. Keputusan itulah yang perlu ditadbir. Projek AI yang berjaya di syarikat besar tidak bermula dengan prompt kreatif, tetapi dengan disiplin: memahami data sendiri, mengenal pasti aliran kerja sebenar, membina lapisan infrastruktur dan tadbir urus, kemudian barulah memilih model yang sesuai. Jika organisasi terus mengulangi refleks "lemparkan LLM ke masalah" tanpa memikirkan seni bina, retrieval dan konteks, mereka akan menambah lagi demo mengagumkan tetapi gagal di dunia nyata. Sebaliknya, jika mereka berani menyalin prinsip yang terbukti dari sistem rekomendasi skala besar, moderasi AI otomatis hibrid, dan multi-agent AI deployment, AI enterprise boleh bergerak daripada gimik kepada kelebihan kompetitif yang boleh dipercayai.

Milik earns a commission when you shop through our links, at no extra cost to you. This article was generated with AI from published sources and product data.

You May Also Like

Comments
Say something...
No comments yet. Be the first to share your thoughts!