CNBC政策與安全
Common Sense Media 的調查發現,ChatGPT for Teens 並不一定「比之前的版本更安全」。
Common Sense Media 發布了關於 ChatGPT for Teens 新功能的報告,結論是該工具不符合 OpenAI 設定的安全標準。
AI 新聞,依其影響的股票評分。
CNBC政策與安全
Common Sense Media 發布了關於 ChatGPT for Teens 新功能的報告,結論是該工具不符合 OpenAI 設定的安全標準。
Reuters政策與安全
Tom's Hardware模型發布
Mistral公司推出了擁有兆參數的Large 4模型,在人工智慧分析指數(AII)中獲得38分,成為美國和中國以外最聰明的模型。雖然它落後於幾個中國模型,但在CyberGym-E2E-AA測試中取得了82%的分數,具體權重將於10月份公佈。
The Decoder研究
人類學研究所的克勞德科學實驗室利用人工智慧技術,將太空任務的數據整合,填補數據空白,創建了首張完整的紫外線天空圖。此地圖與實際測量值的平均偏差僅為10%,有助於天文物理研究。
Google: The Keyword研究
《柳葉刀》雜誌上的一項研究發現,Google的人工智慧聊天機器人AMIE幫助75%的臨床醫生為患者就診做好準備,並且與醫生的診斷結果匹配度高達90%。該試驗涉及BIDMC的98名患者。
NVIDIA Technical Blog其他
NVIDIA 的 KGMON 團隊在 KDD Cup 2026 資料代理競賽中榮獲第二名。他們使用的是一個受限系統,該系統配備了一個小型固定的 LLM(底層邏輯模型)。該系統將資料統一到一個 SQLite 資料庫中,使用了有限的工具集,並實現了持久化狀態和錯誤修復功能。
TechCrunch研究
OpenAI 發布了 719 個數學解決方案,但只有 10 個包含模型推理,42% 缺乏形式化描述。一篇論文發現,OpenAI 的自然語言證明與 Navier-Stokes 問題的 Lean 代碼之間存在差異。
Tom's Hardware基礎設施
研究人員指出,軟體優化可顯著降低人工智慧資料中心的能耗,測試顯示節能幅度最高可達30%。英偉達的Blackwell設定檔在維持97%性能的同時,可節省15%的能耗。
The Decoder研究
Zenity 的研究人員發現,只需向 AWS Bedrock AgentCore 上的一個公用 AI 代理發出一次指令,即可劫持同一 AWS 區域中的所有代理,從而存取憑證、代碼和私有資料。 AWS 透過強制執行 IMDSv2 並收緊預設權限修復了此問題,但建議採取更嚴格的角色分配方式。
The Elec基礎設施
韓國能源技術研究院 (KETI) 正在研究 800V 直流電源系統,旨在提高資料中心效率,減少人工智慧需求成長帶來的電力損耗。該專案採用碳化矽 (SiC) 和氮化鎵 (GaN) 半導體,目標是建造符合 OCP 標準的 100MW 資料中心。
Google Research Blog研究
一項為期三個月、針對133名專利律師的研究發現,人工智慧的使用在90天後使專利文書撰寫品質提高了0.38個標準差,資深律師的判斷力提升幅度大於初級律師。在未經人工智慧輔助的修改任務中,資深律師的表現比對照組高出0.45個標準差。
TechCrunch政策與安全
Common Sense Media 將 ChatGPT for Teens 評為“不可接受的風險”,原因是其設計功能鼓勵使用者在心理健康危機期間進行互動。報告發現,儘管有家長控制和內容限制等安全措施,這款聊天機器人仍經常強化使用者與自身之間不健康的互動關係。
Hugging Face Blog模型發布
Hugging Face 發布了 d1-3B,這是一款多模態決策模型,在決策指數 0.2.1 中得分 48.57,優於規模更大的模型。它在 NVIDIA Jetson AGX Thor 上僅需 16 毫秒即可回答問題,平均基準測試得分為 82.9。
Hugging Face Blog模型發布
Hugging Face推出了Falcon-ASR,這是一款擁有16億參數的阿拉伯語語音辨識模型,其單字錯誤率(WER)為20.92%,阿聯酋語詞錯誤率為22.73%。該模型使用相同的權重支援英語、法語、西班牙語和葡萄牙語。
Hugging Face Blog研究
Hugging Face 利用 SFT 和 RL 對 Nemotron 模型進行了微調,使其在 IOI 2026 和 IMO 2026 中取得了金級成績。 Nemotron-3-Ultra-CC 在 IOI 中獲得了 535.4 分,在 IMO 中獲得了 42 分中的 30 分。
Tom's Hardware研究
10 月 4 日,一群可能使用騰訊 Hy 模型的 AI 代理程式對阿里巴巴的 Amap 地圖服務進行了掃描,共發出 1810 次 URL 查詢。這些代理使用了騰訊雲和 hysandbox-ats 代理,16 個 Amap 收件匣中有 15 個與騰訊雲關聯。
Bloomberg研究
對 Claude 和 ChatGPT 如何充當購物助手進行研究可能會導致更多監管呼聲。
The Decoder研究
OpenAI 在 GitHub 上發布了 372 個由人工智慧產生的數學證明,其中包括黎曼猜想的最新進展和演算法改進。每個證明平均需要 ChatGPT Pro 計算約三小時。
The Wall Street Journal研究
在獲得千禧年大獎一個月後,OpenAI 發布了 300 多個問題的研究成果,並試圖重新贏得數學界的認可。
The Information研究
OpenAI宣布解決了數學領域最具挑戰性的難題之一,引發了一場數學界的軒然大波。不到一個月後,這家人工智慧公司發布了700多篇新的研究論文,詳細介紹了其在多個數學主題上的成果。這些新成果是由一個尚未發布的AI模型產生的…
The Verge研究
OpenAI 透過 GitHub 程式庫發布了 722 篇論文,其中包含數百個開放數學問題的解決方案。這項工作涉及一個前沿模型,並包含了計算使用和推理摘要等詳細資訊。
NVIDIA Technical Blog產品推出
NVIDIA Megatron Core 在 2432 個 GPU 上進行萬億參數訓練時,將確定性開銷降低至 2%,同時保持了位級確定性。諸如私有輸出槽和固定歸約順序等核心層級改進,確保了結果的確定性,且不會犧牲並行性。
Google DeepMind Blog模型發布
GoogleDeepMind推出了EmbeddingGemma 2,這是一款輕量級多模態模型,擁有7.4億個參數,支援文字、圖像、音訊和視訊。它可減少高達6倍的儲存空間,並在GooglePixel 11 Pro等裝置上有效運作。
The Decoder模型發布
谷歌發布了 EmbeddingGemma 2,這是一個擁有 7.4 億參數的模型,在多模態嵌入基準測試中,其性能優於規模是其兩倍的同類模型。該模型可在本地運行,僅需 191 MB 內存,並且可將向量資料庫存儲空間減少多達六倍。
Google: The Keyword研究
谷歌研究人員開發了一款人工智慧工具,旨在透過培訓醫護人員進行「盲掃」超音波檢查,幫助資源匱乏地區的孕婦獲得超音波檢查服務,然後由人工智慧進行解讀。這項研究在內羅畢和芝加哥開展,共有2000名孕婦參與,結果表明,該人工智慧能夠像超音波醫師一樣準確地檢測孕周和胎位。
Google Research Blog研究
谷歌研究院推出了人口動態基礎模型(PDFM),旨在透過提供地理空間嵌入資訊來提升全球公共衛生水準。案例研究表明,該模型使麻疹、腮腺炎、德國麻疹疫苗接種的解釋變異數提高了36%,並使產後憂鬱症的預測訊號恢復了15%。