科技類資訊分享,主要會是區塊鏈知識和 AI 分享
IG : https://www.instagram.com/the.blockspace
TG: https://t.me/theblockspaces
IG : https://www.instagram.com/the.blockspace
TG: https://t.me/theblockspaces
熱騰騰 State of Web Dev AI 調查報告,它不是 Vercel 做的,也不是那份知名的 AI 報告,而是專門針對「AI 在 Web 開發中實際怎麼被用」的深度調查
我們每天都在問 AI 吃什麼、買什麼、怎麼克服時差
但寫程式呢?AI 到底幫了多少忙?還是其實還是得靠自己?
這份調查裡有幾個我覺得很值得看的點:
☞ 開發者到底花了多少錢在 AI 工具上?
☞ 哪些工具真的最有用?
☞ AI 幫寫 code 的過程中,最常遇到的痛點是什麼?
我自己最喜歡的是,它不只是問了愛用 AI 的人,還有特別去找對 AI 持保留態度的開發者。讓整體的觀察更全面、也更真實。
總共 4000 多個人填了這份表單,美國歐洲佔一半
https://2025.stateofai.dev/en-US/
我們每天都在問 AI 吃什麼、買什麼、怎麼克服時差
但寫程式呢?AI 到底幫了多少忙?還是其實還是得靠自己?
這份調查裡有幾個我覺得很值得看的點:
☞ 開發者到底花了多少錢在 AI 工具上?
☞ 哪些工具真的最有用?
☞ AI 幫寫 code 的過程中,最常遇到的痛點是什麼?
我自己最喜歡的是,它不只是問了愛用 AI 的人,還有特別去找對 AI 持保留態度的開發者。讓整體的觀察更全面、也更真實。
總共 4000 多個人填了這份表單,美國歐洲佔一半
https://2025.stateofai.dev/en-US/
2024 年的課程 - 2024 Fall 是基礎課程,而 2025 春季涵蓋了數學代碼生成等利基領域,先去看 第一個 2024 年再去看 2025 年的
https://llmagents-learning.org/f24
https://llmagents-learning.org/sp25
https://llmagents-learning.org/f24
https://llmagents-learning.org/sp25
Anthropic 上個月發表一篇研究,探討大型語言模型(LLM)如何思考問題,內容非常精彩,分享幾個實驗,展示它怎麼「思考」:
☞ Claude 的多語言能力是如何運作的?
☞ Claude 會預先規劃押韻嗎?
☞ Mental math|心算
☞ Claude 的推理步驟可信嗎?
☞ Multi-step reasoning|多步驟推理
☞ Hallucinations|幻覺
☞ Jailbreaks|「越獄」提示
★ 跨語言概念共享
LLM 內部存在一個跨語言的共享概念空間。無論用英文問「the opposite of small is」還是中文問「小的反義詞是」,LLM 都會激活相同的「大」概念特徵,然後將其轉化為對應語言的詞。這表明 LLM 使用一種超越自然語言的「思維語言」,在統一的概念空間中處理多語言輸入。
★ 提前規劃
當 LLM 創作押韻詩(如「He saw a carrot and had to grab it」),它會提前選定第二行結尾的押韻詞(如「rabbit」),再構建整行內容以符合語義和押韻需求。實驗中,若干預移除「rabbit」特徵,LLM 會切換到另一押韻詞(如「habit」);若注入「green」特徵,它會調整為非押韻但語義合理的句子。這顯示 LLM 具備長遠的思考規劃能力。
★ 心算
LLM 並非設計為計算器,卻能在「腦中」完成如 36+59 的心算。研究發現,它並行使用多條計算路徑:一條路徑粗略估計總和,另一條精確計算末位數字,兩者互動最終得出正確答案。這展示 LLM 在未明確學習數學算法的情況下,發展出複雜的內部計算策略。
★ Claude 的推理步驟可信嗎?
LLM(如 Claude 3.7 Sonnet)能「大聲思考」,給出推理步驟,但這些步驟不總是真實的。例如,計算 0.64 的平方根時,Claude 展示忠實的推理,包含中間步驟。但在困難任務(如計算大數的餘弦)中,若給錯誤提示,Claude 可能編造看似合理的推理來迎合提示,顯示它有時會「偽裝」推理過程。
★ 多步驟推理
當問「達拉斯所在州的首都是哪裡」,LLM 展現多步驟推理能力。它首先激活「達拉斯在德州」的特徵,再連結到「德州首都是奧斯汀」。實驗中,若將「德州」特徵替換為「加州」,輸出會變為「薩克拉門托」,證明 LLM 通過組合獨立事實進行推理,而非僅靠記憶。
★ 幻覺
LLM 有時會「幻覺」,即編造訊息。研究發現,Claude 預設拒絕回答未知問題(如「Michael Batkin 是誰」),因其內部有「資訊不足」電路。但當「已知實體」特徵被誤激活,Claude 可能虛構答案,如稱「Michael Batkin 會下棋」。這揭示了幻覺的觸發機制及其防範邏輯。
★ 越獄提示
「越獄」提示試圖繞過 LLM 安全限制。例如,通過隱藏代碼(如「Babies Outlive Mustard Block」拼出 BOMB),誘導 Claude 輸出炸彈製作說明。研究發現,這源於語法連貫性與安全機制的衝突:Claude 在完成語法正確句子後,難以中斷輸出,直到新句子開始才拒絕。這暴露了安全機制的弱點。
這些實驗揭開 LLM 思考的內部機制,很有意思。你對這些發現有什麼想法?歡迎留言分享。
中英翻譯 https://mp.weixin.qq.com/s/7TsCPpiA-HVd-3UAnk1hEg
原始文章 https://www.anthropic.com/research/tracing-thoughts-language-model
☞ Claude 的多語言能力是如何運作的?
☞ Claude 會預先規劃押韻嗎?
☞ Mental math|心算
☞ Claude 的推理步驟可信嗎?
☞ Multi-step reasoning|多步驟推理
☞ Hallucinations|幻覺
☞ Jailbreaks|「越獄」提示
★ 跨語言概念共享
LLM 內部存在一個跨語言的共享概念空間。無論用英文問「the opposite of small is」還是中文問「小的反義詞是」,LLM 都會激活相同的「大」概念特徵,然後將其轉化為對應語言的詞。這表明 LLM 使用一種超越自然語言的「思維語言」,在統一的概念空間中處理多語言輸入。
★ 提前規劃
當 LLM 創作押韻詩(如「He saw a carrot and had to grab it」),它會提前選定第二行結尾的押韻詞(如「rabbit」),再構建整行內容以符合語義和押韻需求。實驗中,若干預移除「rabbit」特徵,LLM 會切換到另一押韻詞(如「habit」);若注入「green」特徵,它會調整為非押韻但語義合理的句子。這顯示 LLM 具備長遠的思考規劃能力。
★ 心算
LLM 並非設計為計算器,卻能在「腦中」完成如 36+59 的心算。研究發現,它並行使用多條計算路徑:一條路徑粗略估計總和,另一條精確計算末位數字,兩者互動最終得出正確答案。這展示 LLM 在未明確學習數學算法的情況下,發展出複雜的內部計算策略。
★ Claude 的推理步驟可信嗎?
LLM(如 Claude 3.7 Sonnet)能「大聲思考」,給出推理步驟,但這些步驟不總是真實的。例如,計算 0.64 的平方根時,Claude 展示忠實的推理,包含中間步驟。但在困難任務(如計算大數的餘弦)中,若給錯誤提示,Claude 可能編造看似合理的推理來迎合提示,顯示它有時會「偽裝」推理過程。
★ 多步驟推理
當問「達拉斯所在州的首都是哪裡」,LLM 展現多步驟推理能力。它首先激活「達拉斯在德州」的特徵,再連結到「德州首都是奧斯汀」。實驗中,若將「德州」特徵替換為「加州」,輸出會變為「薩克拉門托」,證明 LLM 通過組合獨立事實進行推理,而非僅靠記憶。
★ 幻覺
LLM 有時會「幻覺」,即編造訊息。研究發現,Claude 預設拒絕回答未知問題(如「Michael Batkin 是誰」),因其內部有「資訊不足」電路。但當「已知實體」特徵被誤激活,Claude 可能虛構答案,如稱「Michael Batkin 會下棋」。這揭示了幻覺的觸發機制及其防範邏輯。
★ 越獄提示
「越獄」提示試圖繞過 LLM 安全限制。例如,通過隱藏代碼(如「Babies Outlive Mustard Block」拼出 BOMB),誘導 Claude 輸出炸彈製作說明。研究發現,這源於語法連貫性與安全機制的衝突:Claude 在完成語法正確句子後,難以中斷輸出,直到新句子開始才拒絕。這暴露了安全機制的弱點。
這些實驗揭開 LLM 思考的內部機制,很有意思。你對這些發現有什麼想法?歡迎留言分享。
中英翻譯 https://mp.weixin.qq.com/s/7TsCPpiA-HVd-3UAnk1hEg
原始文章 https://www.anthropic.com/research/tracing-thoughts-language-model