大會還沒結束,天問體驗區的測試視頻已經傳遍了各個平台。
第一批視頻大多來自現場記者。
他們沒有精修,也沒有配樂,畫面晃動得厲害,現場嘈雜聲更是從頭響到尾。
偏偏正是這種粗糙,讓不少網友願意相信視頻沒有提前處理。
熱度最高的一條視頻,拍的是那道「林黛玉倒拔垂楊柳」。
天問一本正經地編完故事,現場笑成一片。視頻上傳不到半小時,播放量便突破三百萬。
評論區迅速失控。
【林妹妹忙著拔樹,魯智深已經開始寫葬花詞了。】
【賈寶玉還在旁邊拍手,他是真不怕林妹妹順手拔他。】
【雖然答案錯得離譜,但它居然真能圍繞問題編出完整故事。】
【這不是搜尋引擎,搜尋引擎可沒這麼會胡說八道。】
緊接著,又有人上傳了自己在現場的完整測試。
提問者先讓天問寫一份辭職信,理由是老闆天天讓他加班,卻不願意給加班費。
天問很快給出了正式版本,措辭客氣,內容完整。
提問者接著輸入:「老闆脾氣不好,請寫得委婉一些,不能讓他發現我在罵他。」
天問重新生成了一份。
「感謝公司長期以來對員工抗壓能力的培養。在您的管理下,我逐漸認識到,個人時間並不是每個人都能擁有的寶貴資源。」
現場安靜兩秒,隨後傳來大片笑聲。
視頻評論區同樣熱鬧。
【這哪裡委婉了,老闆看完能把門焊死。】
【建議迴響開放付費版本,我願意花錢讓它替我跟主管說話。】
【有沒有可能,老闆也會買一個,讓天問替他回覆你?】
【完了,以後員工和老闆都不用見面,兩個天問自己吵。】
另一段測試視頻更加專業。
一名財務從業者輸入了三十多行虛構帳目,讓天問找出其中存在的問題。
天問花了十幾秒,指出報銷金額重複、採購單價異常,還發現其中兩張發票的日期早於合同簽署時間。
不過,它把一筆正常的設備折舊也判定成了錯誤。
提問者當場追加問題,要求解釋折舊計算方式。
天問重新梳理數據後,承認上一條判斷有誤,並給出修正結果。
這段視頻讓討論方向發生了變化。
【它居然會承認錯誤?】
【先別吹,財務問題錯一處都可能出大事,目前只能輔助,不能直接使用。】
【沒人說現在就讓它當財務總監。十五億參數的早期版本,能看懂帳目已經很嚇人了。】
【我更關心它為什麼懂合同日期和發票日期的關係。】
【九天實驗室到底給它餵了多少資料?】
現場還有人測試古文翻譯、郵件潤色、商品標題生成、簡單代碼糾錯。
其中一名學生輸入了一段語病很多的社團申請書。
天問不僅修改了語句,還主動刪除了三段重複內容,將兩千多字壓縮到八百字。
學生隨後要求保留原本的口吻,不要寫得過於正式。
第二版很快生成,甚至保留了兩處年輕人常用的口語表達。
這條視頻被大量高校帳號轉發。
【學生會宣傳部連夜申請封禁天問。】
【以後寫活動總結終於不用湊字數了。】
到了晚上八點,相關視頻的累計播放量已經過億。
引力熱搜榜上,前十名被天問占了四個。
【天問大語言模型】
【機器也會寫故事】
【迴響十五億參數模型開放測試】
【程式設計師現場考天問】
回音平台上,大量數碼博主開始逐幀分析現場視頻。
有人統計了天問的響應時間。
普通文字任務通常在三到六秒內開始輸出,涉及長文本分析時,等待時間會增加到十秒以上。
也有人發現,十台體驗設備同時工作後,生成速度出現過明顯下降。
這些細節反而增加了可信度。
如果只是提前錄製好的展示程序,不該出現算力占用升高、回答質量波動和上下文遺忘等問題。
一名參加大會的硬核科普博主,在引力社區上傳了一張現場測試的對話截圖。
截圖裡,他沒有讓天問長篇大論,而是輸入了一個簡短卻暗藏邏輯陷阱的純文本問題。
「房間裡有五個人。甲在看書,乙在下棋,丙在睡覺,丁在寫字。請問戊在幹什麼?」
這是一個經典的隱性條件推理題。
傳統的搜尋引擎遇到這種問題,只會抓取這幾個動作的關鍵詞,給出一堆毫不相干的網頁連結。
但天問在停頓了四秒後,在屏幕上逐字給出了回復。
「戊在和乙下棋。因為下棋通常需要兩個人進行,而甲、丙、丁都有明確的單人活動,所以戊是乙的對手。」
這名博主在截圖上方配了一段評價:
「能力邊界很明顯,它現在還無法處理極其複雜的長文本嵌套,但對於這種簡短的常識推理,它展現出了讓人後背發涼的思考能力。它不僅讀懂了字面意思,還補全了人類沒有寫出來的隱性條件。」
評論區沒有因為問題簡短而冷下來。
【終於看到正常的硬核評測了,前面那些全在寫情書。】
【這才是最恐怖的,它知道下棋需要兩個人,它具備了人類社會的常識!】
【現在就開始擔心人類智力被取代是不是太早了?】
【不早,先擔心自己的飯碗吧。】
然而,天問登上熱搜不到一個小時,質疑內容也開始集中出現。
數十個帳號同時發布長文,標題幾乎一個風格。
《所謂大語言模型,不過是一場精心準備的科技魔術》
《十五億參數製造出來的資本神話》
《迴響天問疑似後台真人回復,現場測試全是托》
文章提出了幾項證據。
體驗區只開放十台電腦,所有設備必須連接雅安伺服器,外界無法獲得模型文件。展示現場也沒有公開完整技術報告,更沒有第三方機構進行獨立驗證。
還有文章聲稱,所謂生成內容只是大型模板庫的組合,後台通過關鍵詞匹配,再由人工進行快速修改。
一張模糊的後台機房照片也被轉發出來。
照片裡坐著幾十名工作人員,標題寫著「天問人工回答團隊疑似曝光」。
水軍很快湧入熱門帖子。
【十台機器,幾十個後台員工,一人盯一台都綽綽有餘。】
【提前準備幾百套腦筋急轉彎答案,現場換幾個關鍵詞,有什麼技術含量?】
【迴響很會做營銷,先是超充,現在又是人工智慧。】
【模型文件為什麼不公開?不敢讓第三方測試吧。】
【寫幾封信猜個謎語就叫思考,那自動回復客服也能叫科學家。】
爭吵很快蔓延到各個平台。
支持者開始翻找不同角度的現場照片和文字記錄。
有人上傳排隊全程,證明問題由體驗者臨時輸入。還有記者公開自己的採訪證件和原始拍攝文件,表示自己沒有收到迴響的測試腳本。
一名大學教師將現場提問的草稿照片發了出來。
他測試的是一道臨時編寫的國際貿易案例,其中故意放入互相矛盾的數字。
天問發現了數字衝突,並拒絕給出確定利潤。
【這道題下午兩點十三分才寫在紙上,輸入前沒有交給任何工作人員。後台人工如何提前準備?】
質疑者立刻跟進。
【語音和鍵盤內容都能實時傳到後台,人工回答根本不需要提前知道。】
【十秒內讀完幾百字,再寫出完整分析,你去找幾個這種人工給我看看。】
【迴響給的錢多,招到高手有什麼奇怪?】
【高手也得打字,屏幕上可是逐字生成。】
雙方從技術吵到資本,又從資本吵到迴響過去發布的產品。
天樞、星閃、天問被全部拉進爭論。
有人說迴響善於製造概念,也有人直接貼出天樞示範站的實測數據,反問此前的造假指控為什麼沒有一項站得住腳。
到了晚上十點,平台上的黑稿已經超過三百篇。
部分文章開始聲稱,天問只是海外開源項目換了中文界面。
可當網友追問具體是哪個項目、論文作者是誰、代碼地址在哪時,發稿帳號卻始終沒有給出答案。
爭論還在升溫。
就在這時候,全球最大的預印本學術平台 arXiv 首頁出現了一條新記錄。
迴響旗下九天實驗室正式上傳了最新的底層架構論文。
論文標題只有一句簡單的英文。
《Attention Is All You Need》