科技類資訊分享,主要會是區塊鏈知識和 AI 分享
IG : https://www.instagram.com/the.blockspace
TG: https://t.me/theblockspaces
Programming Languages

最大宗的還是 JS / TS 另外就是 Python
Code Generation

V0 做得很早期 也相對好
Bolt 可以再加油一下 跟第一名有兩倍差距

最令人頭痛超過五成的人回答的是 code 產生品質很爛
Coding Assistants

第二名第四名都沒聽過 www
讓我有點意外的是 Zed 是第二名超過 Windsurf
熱騰騰 State of Web Dev AI 調查報告,它不是 Vercel 做的,也不是那份知名的 AI 報告,而是專門針對「AI 在 Web 開發中實際怎麼被用」的深度調查

我們每天都在問 AI 吃什麼、買什麼、怎麼克服時差
但寫程式呢?AI 到底幫了多少忙?還是其實還是得靠自己?

這份調查裡有幾個我覺得很值得看的點:
☞ 開發者到底花了多少錢在 AI 工具上?
☞ 哪些工具真的最有用?
☞ AI 幫寫 code 的過程中,最常遇到的痛點是什麼?

我自己最喜歡的是,它不只是問了愛用 AI 的人,還有特別去找對 AI 持保留態度的開發者。讓整體的觀察更全面、也更真實。

總共 4000 多個人填了這份表單,美國歐洲佔一半

https://2025.stateofai.dev/en-US/ State of AI 2025
2024 年的課程 - 2024 Fall 是基礎課程,而 2025 春季涵蓋了數學代碼生成等利基領域,先去看 第一個 2024 年再去看 2025 年的

https://llmagents-learning.org/f24
https://llmagents-learning.org/sp25
Anthropic 上個月發表一篇研究,探討大型語言模型(LLM)如何思考問題,內容非常精彩,分享幾個實驗,展示它怎麼「思考」:

☞ Claude 的多語言能力是如何運作的?
☞ Claude 會預先規劃押韻嗎?
☞ Mental math|心算
☞ Claude 的推理步驟可信嗎?
☞ Multi-step reasoning|多步驟推理
☞ Hallucinations|幻覺
☞ Jailbreaks|「越獄」提示

★ 跨語言概念共享

LLM 內部存在一個跨語言的共享概念空間。無論用英文問「the opposite of small is」還是中文問「小的反義詞是」,LLM 都會激活相同的「大」概念特徵,然後將其轉化為對應語言的詞。這表明 LLM 使用一種超越自然語言的「思維語言」,在統一的概念空間中處理多語言輸入。

★ 提前規劃

當 LLM 創作押韻詩(如「He saw a carrot and had to grab it」),它會提前選定第二行結尾的押韻詞(如「rabbit」),再構建整行內容以符合語義和押韻需求。實驗中,若干預移除「rabbit」特徵,LLM 會切換到另一押韻詞(如「habit」);若注入「green」特徵,它會調整為非押韻但語義合理的句子。這顯示 LLM 具備長遠的思考規劃能力。

★ 心算

LLM 並非設計為計算器,卻能在「腦中」完成如 36+59 的心算。研究發現,它並行使用多條計算路徑:一條路徑粗略估計總和,另一條精確計算末位數字,兩者互動最終得出正確答案。這展示 LLM 在未明確學習數學算法的情況下,發展出複雜的內部計算策略。

★ Claude 的推理步驟可信嗎?

LLM(如 Claude 3.7 Sonnet)能「大聲思考」,給出推理步驟,但這些步驟不總是真實的。例如,計算 0.64 的平方根時,Claude 展示忠實的推理,包含中間步驟。但在困難任務(如計算大數的餘弦)中,若給錯誤提示,Claude 可能編造看似合理的推理來迎合提示,顯示它有時會「偽裝」推理過程。

★ 多步驟推理

當問「達拉斯所在州的首都是哪裡」,LLM 展現多步驟推理能力。它首先激活「達拉斯在德州」的特徵,再連結到「德州首都是奧斯汀」。實驗中,若將「德州」特徵替換為「加州」,輸出會變為「薩克拉門托」,證明 LLM 通過組合獨立事實進行推理,而非僅靠記憶。

★ 幻覺

LLM 有時會「幻覺」,即編造訊息。研究發現,Claude 預設拒絕回答未知問題(如「Michael Batkin 是誰」),因其內部有「資訊不足」電路。但當「已知實體」特徵被誤激活,Claude 可能虛構答案,如稱「Michael Batkin 會下棋」。這揭示了幻覺的觸發機制及其防範邏輯。

★ 越獄提示

「越獄」提示試圖繞過 LLM 安全限制。例如,通過隱藏代碼(如「Babies Outlive Mustard Block」拼出 BOMB),誘導 Claude 輸出炸彈製作說明。研究發現,這源於語法連貫性與安全機制的衝突:Claude 在完成語法正確句子後,難以中斷輸出,直到新句子開始才拒絕。這暴露了安全機制的弱點。

這些實驗揭開 LLM 思考的內部機制,很有意思。你對這些發現有什麼想法?歡迎留言分享。

中英翻譯 https://mp.weixin.qq.com/s/7TsCPpiA-HVd-3UAnk1hEg
原始文章 https://www.anthropic.com/research/tracing-thoughts-language-model Tracing the thoughts of a large language model
Back to Top