Transcription
Kita semua sudah pernah mendengar tentang mitos Claude dari Enthropic sekarang. Ini adalah model claude internal yang belum dirilis yang konon ditahan dari publik karena kemampuan keamanan siber dan peretasan otonomnya yang canggih. Secara pribadi, saya pikir ini adalah gimmick pemasaran untuk membangun hype. Tetapi terlepas dari itu, model tersebut tampaknya masih sangat mampu. Di video terakhir saya, saya berbicara tentang bagaimana Claude Mythos terlihat di konsol Google Claude di bawah bendera pratinjau Claude Mythos 1, yang menunjukkan bahwa titik akses terverifikasi tertentu mungkin telah mendapatkan akses ke model melalui Cloud Code dan Cloud Security. Tetapi sekarang kita akhirnya memiliki beberapa keluaran bocor dari penguji internal dan tim merah. Dan sejujurnya, kualitasnya terlihat cukup solid. Sekarang, inilah generasi seni pai pesawat ruang angkasa Saturnus bocor pertama dari Claude Mythos. Dan sejujurnya, ini sebenarnya cukup liar dan merupakan keluaran kode yang solid dalam seni pai. Ini adalah sesuatu yang dihasilkan dari sumber terpercaya di Twitter, yang namanya tidak dapat saya ungkapkan, tetapi saya cukup yakin Anda pasti pernah melihat namanya di sekitar. Ini jelas menunjukkan bahwa model tersebut menghasilkan adegan secara menyeluruh dengan pustaka Python. Dan secara keseluruhan, hasilnya cukup mengejutkan bersih. Cincin Saturnus, gradien, bintang, bahkan pesawat ruang angkasa kecil semuanya bersatu dengan cukup baik secara koheren. Sekarang, saya tidak mengatakan ini adalah generasi yang gila. Kebanyakan model sebenarnya dapat menghasilkan sesuatu dengan kemampuan yang sama. Jadi, ini bukan sesuatu yang luar biasa, tetapi sejujurnya, ini persis seperti yang ingin saya lihat dari mitos karena ini menunjukkan bahwa model tersebut sebenarnya dapat menghasilkan keluaran visual yang fungsional melalui kode alih-alih hanya menulis skrip acak yang hampir tidak berfungsi. Dan jelas ini bukan render yang sangat kompleks, tetapi untuk build pratinjau bocor awal, ini adalah pekerjaan yang terhormat dan pasti menunjukkan koherensi pengkodean yang kuat dari model tersebut. Sekarang, kita baru saja melihat generasi seni pai itu, tetapi yang membuatnya lebih gila adalah bahwa pratinjau Claude Mythos sudah menduduki peringkat nomor satu di exploit bench, yang merupakan tolok ukur baru, dan skornya 69 persen. Dan modelnya bahkan belum dirilis untuk umum. Di sinilah exploit bench mendapatkan akses ke model ini dan pada dasarnya ini adalah tolok ukur untuk mengukur seberapa mampu model AI dalam eksploitasi perangkat lunak dunia nyata. Tidak hanya menemukan kerentanan, tetapi benar-benar berkembang melalui seluruh rantai eksploitasi dari penemuan kode yang rentan hingga eksekusi kode arbitrer. Dan sejujurnya, dengan model Frontier yang berkembang begitu cepat, itulah sebabnya alat seperti Open Router pasti membantu dan menjadi lebih berguna karena pengembang membutuhkan cara sederhana untuk dengan cepat menguji dan membandingkan serta beralih di antara semua model yang berbeda tanpa membangun kembali seluruh tumpukan teknologi mereka setiap hari. Jadi, untuk menunjukkan apa yang saya maksud, saya akan menggunakan fitur bandingkan Open Router, dan Anda pada dasarnya dapat menjalankan prompt front-end yang sama persis di dua model yang berbeda. Dalam kasus ini, saya membandingkan Claude Opus 4.7 dengan Gemini 3.5 Flash untuk melihat model mana yang lebih baik dalam desain front-end. Jelas, ini hanya satu tolok ukur, tetapi saya menggunakan prompt halaman arahan HTML SAS file tunggal dengan React GSAP scroll driven typography dan animasi tanda tangan. Dan di sinilah open router benar-benar berguna karena alih-alih menebak model mana yang lebih baik untuk pekerjaan front-end, saya dapat mengujinya berdampingan. Sekarang, saya pada dasarnya dapat membandingkan keluarannya. Inilah yang dihasilkan Gemini 3.5 Flash, yang terlihat luar biasa. Dan inilah yang dihasilkan Opus 4.7 dengan halaman arahan ini. Dan keduanya benar-benar melakukan pekerjaan yang luar biasa. Saya bahkan dapat mengujinya berdampingan. Di sinilah saya dapat membandingkan model yang berbeda seperti Claude Opus 4.7, GPZ 5.5 serta Gemini 3.5 Flash yang baru. Dan dalam fitur bandingkan, saya sebenarnya dapat melihat kualitas keluaran, membandingkan kecepatan di antara model, harga, dan memutuskan mana yang sebenarnya terbaik berdasarkan setiap tugas individu. Anda bahkan dapat menyorot yang terbaik di antara penyedia yang berbeda ini. Karena terkadang model termahal memberi Anda selera desain dan struktur yang lebih baik, tetapi terkadang model yang lebih cepat atau lebih murah memberi Anda 80% dari bobot di sana dengan biaya jauh lebih sedikit. Hal lain yang juga saya perhatikan adalah bahwa Open Router memungkinkan Anda menguji model yang lebih baru dan kurang dikenal dengan sangat cepat tanpa perlu terus-menerus mengubah pengaturan Anda setiap kali ada sesuatu yang baru dirilis. Open Router juga memiliki SDK, API respons terpadu, sistem fallback perutean untuk keandalan dan dukungan untuk model frontier dan open-source yang lebih baru saat mereka diluncurkan. Dan itu sebenarnya sangat berguna. Dan untuk memamerkan apa yang telah saya lakukan secara visual dengan SDK ini adalah membangun dasbor perutean AI ini. Dan ini menggunakan SDK open router di mana permintaan yang berbeda secara otomatis dirutekan di antara model seperti opus gemini deepseeek bahkan memiliki model k yang lebih tua dan ki tergantung pada latensi tugas serta keandalan fallback. Inilah yang dapat Anda lakukan dengan SDK ini. Jadi, jika Anda ingin menggunakan model AI dengan API terpadu, membangun agen, alat pengkodean, atau aplikasi AI di mana pilihan model benar-benar penting, lihatlah open router dengan tautan di deskripsi di bawah. dan juga terima kasih kepada mereka karena telah mensponsori video hari ini. Sekarang, kembali ke video, beberapa area di mana slug model baru ini terlihat adalah di seluruh aplikasi Claude. Di sinilah Mythos preview 1 terdaftar di sini langsung di dalam aplikasi. Dan dari tangkapan layar bocor ini, kita juga dapat melihat referensi ke model pratinjau. Ini adalah sesuatu yang baru-baru ini dirilis dalam Google Cloud Vortex. Dan pada dasarnya ini adalah model yang memiliki pemikiran adaptif dan sistem yang pada dasarnya akan memiliki sistem pemikiran baru. Dan saya tidak berpikir ini akan dirilis ke publik, tetapi bisa jadi varian yang mungkin mereka rilis nanti. Sekarang, bergerak maju dengan gambaran lain baru-baru ini tentang apa yang mungkin mampu dilakukan oleh Mythos. Dan sejujurnya, yang ini jauh lebih menarik daripada generasi kode seni pai karena seorang matematikawan Harvard dan peneliti enthropic bernama Levent baru-baru ini membagikan utas yang melibatkan masalah Erdos 90. Dan ini adalah masalah geometri terkenal yang telah ada sejak tahun 1940-an. Ini pada dasarnya melibatkan jumlah maksimum jarak unit antara titik-titik pada sebuah bidang. Dan yang menarik adalah tepat setelah OpenAI dilaporkan menemukan solusi terobosan, Lvent memutuskan untuk menguji Claude Mythos dalam pengaturan terisolasi yang terputus dari jaringan tanpa akses internet dan tanpa paparan terhadap pendekatan OpenAI. Dan menurut utas ini, Mythos secara independen memecahkan masalah tersebut juga. Tetapi tampaknya bagian yang benar-benar menarik adalah bahwa ia tidak hanya konvergen pada jalur penalaran yang sama. Levent sebenarnya menggambarkan pendekatan Mythos sebagai lebih bersih dan lebih elegan di beberapa area. sambil menghindari banyak komplikasi analitis dari metode sebelumnya. Dan yang benar-benar gila adalah bagaimana masalah-masalah ini bertahan selama hampir 80 tahun. Dan sekarang beberapa model frontier mulai bernalar secara independen melaluinya dalam beberapa minggu. Dan bagi saya, di sinilah Mythos menjadi benar-benar menarik. Bukan hanya demo yang mencolok. Kemungkinan bahwa Enthropic sedang membangun model yang sangat kuat untuk penalaran jangka panjang dan kemampuan eksplorasi matematika. Dan yang membuatnya lebih gila adalah Levent sebenarnya menautkan makalah lengkapnya secara publik. Ini adalah makalah matematika 13 halaman yang dipoles sepenuhnya yang dihosting langsung di CDN Enthropic. Dan menurut Levent, penulisan itu sendiri disiapkan oleh Opus 4.7 menggunakan penalaran mentah dan struktur solusi Mythos. Dan sejujurnya, inilah bagian yang benar-benar menonjol bagi saya karena ini bukan hanya klaim tolok ukur yang samar di Twitter. Ini juga bukan utas hype. Ada bukti formal tertulis yang menunjukkan jalur penalaran mitos yang konvergen padanya melibatkan menara kelas lapangan. Anda memiliki norma satu tori dan geometri bilangan untuk mencapai peningkatan polinomial pada masalah jarak unit yang sejujurnya membuat seluruh situasi mitos ini terasa jauh lebih nyata. Sekarang kebocoran baru-baru ini yang kita lihat hanya terkait dengan keamanan cloud yang menampilkan referensi melalui bendera baru ini. Sekarang ini juga tersedia untuk sistem UI perusahaan dan integrasi yang lebih dalam ke dalam alur kerja cloud code dan cloud security. Ini tidak berarti bahwa itu akan diterapkan ke setiap pengguna. Tetapi sejujurnya bagian terpenting di sini adalah bahwa pesan Enthropic seputar mitos tampaknya juga berubah. Sebelumnya, perusahaan sangat menyiratkan bahwa model semacam ini akan tetap dibatasi secara internal karena masalah keamanan terkait keamanan siber otonom dan penelitian kerentanan. Tetapi sekarang, Enthropic baru-baru ini menyatakan bahwa model kelas mitos pada akhirnya dapat tersedia secara umum setelah pengamanan yang lebih kuat diterapkan. Dan sejujurnya, ini adalah pergeseran besar karena menunjukkan bahwa Enthropic tidak lagi memperlakukan mitos sebagai sistem internal yang terkunci secara permanen. Inilah sebabnya mengapa saya mengatakan ini bisa menjadi semacam gimmick yang mereka coba bangkitkan untuk IPO mereka dan rasanya mereka sekarang telah menemukan solusi untuk benar-benar merilis salah satu model pratinjau Mythos mungkin dalam 3 bulan ke depan. Saya pikir itu akan dirilis paling lambat Agustus. Itu hanya pendapat saya. Kita melihat banyak kebocoran ini dan itu pasti mengisyaratkan bahwa Mythos akan segera dirilis. Tapi itu saja, teman-teman. Beri tahu saya apa pendapat Anda tentang rilis baru dan kebocoran baru yang kami temukan. Saya akan meninggalkan semua tautan yang saya gunakan dalam video hari ini di deskripsi di bawah. Pastikan Anda melihat saluran kedua tempat kami memposting berita AI baru setiap hari. Bergabunglah dengan buletin, bergabunglah dengan Discord, ikuti saya di Twitter, dan terakhir, pastikan Anda berlangganan, nyalakan bel notifikasi, sukai video ini, dan silakan lihat video kami sebelumnya agar Anda tetap update dengan berita AI terbaru. Tetapi dengan pemikiran itu, teman-teman, semoga hari Anda luar biasa, sebarkan kepositifan, dan saya akan segera bertemu Anda. Dia menderita.