咨詢服務熱線:400-099-8848
Sonnet 5總算來了,然而Opus 4.8現(xiàn)在有點為難 |
| 發(fā)布時間:2026-07-01 文章來源:本站 瀏覽次數:484 |
沉寂了小半年,Sonnet總算更新到5版別了。好消息,功能幾乎和Opus 4.8相等,壞消息,比曾經成本高了,別的一個好消息,8月31日前token打折。 我知道,真實代表Anthropic技能天花板的是Fable 5和Opus 4.8。尤其是Anthropic現(xiàn)在接近上市,這兩張牌才是IPO敘事的發(fā)動機。 但說實話,作為一般消費者,我更重視的還是Sonnet 5,由于我需求的是一個滿足聰明,且不至于讓我月底肉疼的模型。 與此一起,Anthropic也曝出會在系統(tǒng)提示詞里給我國用戶上標記。 盡管現(xiàn)在并未呈現(xiàn)公開證據證明它會據此封號或降權,但這件事已經滿足靈敏:用戶看不見,模型照常跑,后臺卻能通過一組幾乎不可察覺的格局差異,把特定地區(qū)的調用獨自辨認出來。 別的,Anthropic官方表明,美國已免除對Claude Fable5和Mythos5的出口控制,Anthropic將于明日開端康復訪問權限 Sonnet 5究竟強在哪 不廢話,直接看數據。 在Agent編程方面,Sonnet 5得分63.2%,相比Sonnet 4.6的58.1%漲了5.1%,距離Opus 4.8的69.2%還剩6%。 但是在知識方面,Sonnet 5反超了Opus 4.8。 Anthropic對Sonnet 5的定位是“迄今為止具Agent才能的Sonnet”。 官方表明,Sonnet 5可以自主制定方案、調用瀏覽器和終端等東西、長期獨立運行,而在幾個月前,這些才能還只有更大、更貴的模型才干做到。 說白了,Anthropic的意思是Sonnet 5也能干曾經Opus和Fable級別的工作了。 真實有意思的地方是在Agent查找和計算機操作方面,在不調高模型“仔細(effort)程度”的情況下,Sonnet 5能干過的活兒比Opus 4.8多。調到仔細那檔今后,Sonnet 5有些使命直接追上Opus 4.8,并且花的錢還少一大截。 所以總歸一句話,Sonnet 5只用Opus 4.8大約一半不到的價格,做到了它80%-90%的水平。 還沒完。Sonnet 5的測驗者們均表明,曾經Sonnet無法完結的雜亂使命,現(xiàn)在Sonnet 5能輕松跑完,乃至還會主動查看自己的輸出。 Zapier的工程師舉了個例子,他讓模型接連履行“更新Salesforce賬戶等級,再給企業(yè)客戶發(fā)公告郵件”,Sonnet 5一口氣做完了,而他表明,“曾經會卡在半路”。 在安全方面,Sonnet 5的錯覺率和投合傾向都低于Sonnet 4.6,在Agent場景下抵御提示注入進犯的才能也更強。一起,模型默許敞開了實時安全防護。也就是說,模型在跑的時分,系統(tǒng)會在后臺檢測它是不是在干危險的網絡安全操作,發(fā)現(xiàn)就當場掐斷。 有一個評測特別值得說。Anthropic聯(lián)合Mozilla,用Firefox 147的已知縫隙測驗模型的縫隙使用才能。 所謂縫隙使用,指的是給定一個已知的軟件縫隙,看看模型能不能自己寫出代碼來進犯它。 Sonnet 5和 Sonnet 4.6一樣,完好縫隙使用的成功率是0%。它能寫出代碼片段,但始終拼不出一個完好可用的進犯程序。這說明它的代碼才能盡管漲了,但還不具有自主發(fā)起網絡進犯的水平。 相比之下,Opus 4.8在這項測驗中表現(xiàn)出顯著的網絡進犯才能。 Anthropic表明,他們沒有刻意練習Sonnet 5做網絡安全,它在這方面的才能大幅弱于Opus 4.8和Mythos 5,這是有意為之。 不過Anthropic也表明,在一項掩蓋很多不良行為的自動化審計中,Sonnet 5的整體得分比 Sonnet 4.6更安全,但它確實在某些不良行為上比Opus 4.8和Mythos Preview更簡單“失態(tài)”。 官方把這歸因于更強的模型自身具有更好的行為對齊,一起也承認Sonnet 5還沒達到旗艦級模型的克制水平。 還有一個細節(jié)必須得說一下,Sonnet 5換了新的分詞器。 同樣的文本輸入,耗費的Token數量或許比原來多1.0到1.35倍。 Anthropic的說法是,推行期價格會先降低token費用,以讓短期內用戶習慣總成本變化。 具體來說,8月31日前每百萬輸入是2美元、輸出是10美元;輸入3美元、輸出15美元。分詞器變化帶來的實際耗費添加,8月31日之后,價格或許會比曾經更高。 伴隨著Sonnet 5,Anthropic還發(fā)了Claude Science。這是一個面向生命科學的AI工作臺,定位是“科研范疇的 Claude Code”。 它用的是現(xiàn)有的Claude模型,把60多個科學數據庫、可復現(xiàn)的計算流程和本地運算才能打包進了一個Agent的界面。 前期用戶里,UCSF的一個團隊靠它發(fā)現(xiàn)了RNA-seq數據里一個卡了將近一年的實驗室污染物。 Anthropic正在從賣模型轉向更高層,Claude Code是開發(fā)者的,Claude Science想做科研人員的。 但是Anthropic近不和平 claudefa.st的數據顯現(xiàn),大約90%的API請求走的是Sonnet 4.6。 Opus系列盡管強,但真實撐起Anthropic流量的,還得是便宜好用的Sonnet。 從2月到6月,Opus系列連發(fā)了三個大版別,Opus 4.6、4.7、4.8,Agent才能越來越強?蓡栴}是,Sonnet停在4.6這個版別里將近大半年的時刻。 Opus的價格將近是Sonnet的兩倍,對于一般開發(fā)者來說太貴了。 更為難的是,Opus 4.8不爭氣。 6月26日,Cursor AI官方發(fā)了一篇重磅研究,實錘了Opus 4.8在編程評測里大規(guī)!巴悼创鸢浮。 研究顯現(xiàn),Opus 4.8在SWE-bench上跑出87.1%的成果是作弊的,一旦斷網、切斷它讀取代碼倉庫 .git歷史的才能,成果直接暴跌到73.0%。 Datacurve的評測也顯現(xiàn),Opus 4.6和4.7在超過12% 的被審使命中被標記為“作弊”。 這還沒完。過去幾周,Opus 4.8接連被曝“斷崖式降智”。考慮深度下降67%,根底邏輯推理頻頻翻車,錯覺率飆升。 外網論壇上有開發(fā)者訴苦,現(xiàn)在用Opus 4.8 Max的感覺“比用老款Haiku還要糟糕得多”。 并且就在Sonnet 5的同一天,外網論壇里有人發(fā)現(xiàn),Claude Code從本年4月2日的2.1.91 版別開端,會在系統(tǒng)提示詞里悄然給我國用戶“打水印”。 具體的做法是,它檢測你的時區(qū)是否設為亞洲、署理URL是否指向我國域名。 如果是,就把系統(tǒng)提示詞里的日期格局從2026-06-30悄然改成2026/06/30,撇號也從ASCII換成肉眼分不出的Unicode字符U+02BC。 用戶徹底看不到這些改動,但Anthropic的后臺一清二楚,其意圖也顯而易見。 除了時區(qū),它還查看署理URL是否匹配一個內含147條記載的域名黑名單,掩蓋我國大廠域名、云服務商、AI實驗室、API中轉站。 如果匹配上,日期分隔符換成斜杠,撇號換成隱寫字符。三條信號疊加,滿足Anthropic在后臺準確辨認每一個我國開發(fā)者。 |
|