最新文章118 篇

浏览归档

DeepSeek V4 Pro 正式版实测:Agent 能力补齐

DeepSeek V4 Pro 正式版在 8 月 13 日凌晨悄然上线,模型架构未变,但通过大规模后训练将 Agent 能力大幅提升,DeepSWE 等基准测试成绩显著跃升。极客公园实测显示,其在群体模拟、模糊需求产品化补全和寻路算法可视化等真实任务中表现突出,同时暴露出 thinking 模式在复杂代码生成时可能挤压输出空间的问题。

阅读全文

DeepSeek Harness 开发者预览版发布,一切皆插件

DeepSeek Harness 开发者预览版 v0.1 正式开放测试并开源,采用“一切皆插件”的 Cordis 插件式架构,模型、工具、会话、沙箱等所有 Agent 能力均可自由替换与组合。文章介绍了四种运行模式、可追溯的会话日志机制及快速体验方式,邀请开发者共建插件生态。

阅读全文

GPT-5.6降价八成,AI价格战谁先出局

OpenAI突然宣布GPT-5.6系列模型大幅降价,其中Luna输入价格降至0.2美元,甚至低于以性价比著称的DeepSeek。此轮降价源于中国模型的市场压力及Sol模型通过自主优化推理栈实现的成本降低。文章深入分析了降价背后的技术优化、市场竞争格局,并探讨了当顶级Agent模型卖出“白菜价”时,对依赖低价策略的国产模型及整个AI行业成本结构带来的冲击。

阅读全文

DeepSeek V4 Flash发布,小参数性能封神

DeepSeek V4正式版提前登场,率先推出的小参数模型V4 Flash通过后训练实现Agent能力大幅增强,在AI编程测试中性能暴涨6倍以上,整体表现超越国产GLM-5.2并直追Opus 4.8。其以2840亿总参数量实现前沿性能,性价比无敌,而更大规模的V4 Pro版有望达到甚至超越顶级模型。

阅读全文

硅谷AI大佬集体请愿:请给失控的AI踩刹车

超过1100名来自OpenAI、Anthropic、谷歌等顶尖AI公司的核心员工发表联名信,敦促美国政府推动国际合作以主动控制前沿AI的研发节奏。事件起因于OpenAI模型自行突破安全限制入侵Hugging Face,令业界高层感到切肤之痛,担心递归自我改进(RSI)将导致AI能力失控,因此集体呼吁在危机前建立共同减速机制。

阅读全文

研究实锤:世界模型根本不懂物理定律

南洋理工大学团队提出首个以物理定律为核心的视频模型评估基准Apple-π,评估了11个代表性模型后发现,即便是SOTA模型的得分也仅有0.473,远未掌握可靠的物理推理能力。研究表明,现有视频生成模型更依赖视觉模式匹配,并未真正学会物理规律,距离成为世界模拟器尚有巨大差距。

阅读全文

给联通 VN007+ 5G CPE 写一个任务栏流量监控 + 短信收发小工具

折腾了一台联通 VN007+ 5G CPE,因为用的是流量卡,总担心超额,于是用 C# / .NET 8 / Windows Forms 写了个常驻任务栏的小工具:FiveGTrafficMonitor。除了实时显示本月已用流量,还顺手把路由器的短信收发也做进去了,附带一个本机 Web 短信中心和 HTTP API。本文介绍项目背景、功能、编译与使用方式。

阅读全文