最新文章
    华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码
    华为天才少年的开源AI Agent全书:6700星、十章、可跑实验代码

    GitHub 上最近冲上 Trending 榜首的 bojieli/ai-agent-book,两天内收获超过 1700 颗星,总星标突破 6700。这不是又一个 Demo 项目或 API 封装库——它是一本完整的技术书:李博杰所著《深入理解 AI Agent:设计原理与工程实践》,全书正文、配图、编译版 PDF 和按章配套的实验代码全部开源。

    作者的身份本身就是这

    北欧健走5周内显著缓解抑郁:64人随机对照试验
    北欧健走5周内显著缓解抑郁:64人随机对照试验

    抗抑郁药通常需要 2 到 6 周才能看到明显效果。在这段等待期里,患者往往处于最痛苦的状态。一项发表于《情感障碍杂志》(Journal of Affective Disorders)的随机对照试验发现,监督式北欧健走训练在 5 周内就产生了大幅度的抑郁症状改善,基线抑郁程度越重的参与者,改善速度越快。

    研究设计

    研究团队由法国克莱蒙奥弗涅大学的 Clément Ginoux 领导,招募了 64 名中度至重度

    Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成
    Voicebox:43K Stars 的开源 AI 语音工作室,7 引擎 TTS + MCP Agent 集成
    Voicebox:一个开源项目把 ElevenLabs 和 WisprFlow 的活都干了

    当 AI 语音工具的市场被两家公司分占时——ElevenLabs 主导语音合成输出,WisprFlow 主导语音听写输入——一个名为 Voicebox 的开源项目正在尝试同时覆盖这两端,并且把整套流程跑在你自己的机器上。

    Voicebox 由开发者 Jamie Pine 创建,目前在 GitHub 上拥有超过 43,000 颗星,日增 star 数稳定在 600 以上,是语音 AI 领域增长最快的开源项目之一。它定位为「local-first AI voice studio」:免费、开源(MIT

    Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺
    Qwen3.8 发布:2.4T 参数、原生多模态、开放权重承诺

    7 月 19 日,阿里巴巴通义千问(Qwen)团队在 X 平台发布 Qwen3.8,宣称参数规模达到 2.4 万亿(2.4T),并承诺将开放权重(open-weight)。这是 Qwen 家族首次有模型突破万亿参数门槛并具备原生多模态能力。Qwen 团队将其定位为"仅次于 Anthropic Fable 5 的最强模型"。

    Qwen3.8-Max-Preview 已在 Alibaba 的 T

    2026 年 AI 都学会了记忆,但你的记忆不属于你
    2026 年 AI 都学会了记忆,但你的记忆不属于你

    2026 年 6 月 4 日,OpenAI 发布了一篇题为《为 ChatGPT 记忆打造更强基础》的博客,推出名为 Dreaming(做梦) 的新一代记忆系统。这个名字本身就是一个精心设计的隐喻:人在睡眠时整理白天的记忆,ChatGPT 在后台整理你的聊天历史。

    但浪漫的命名之下,是一个工程上相当激进的系统重构。更值得注意的是,2026 年上半年,ChatGPT、Claude、Gemini、Grok、Microsoft 365 Copilot 五家主流 AI 助手全部上线或升级了记忆功能。五大厂商不约而同地在同一个时间窗口押注同一方向,这绝非巧合。

    ![OpenAI Memory

    transcribe.cpp:一个 ggml 运行时跑完 16 个语音转文字模型家族
    transcribe.cpp:一个 ggml 运行时跑完 16 个语音转文字模型家族

    本地语音转文字的开发者,长期以来面对一个尴尬的现实:能用的推理栈屈指可数。OpenAI 的 Whisper 有官方 Python 实现和社区维护的 whisper.cpp,NVIDIA 的 Parakeet 和 Canary 必须跑在笨重的 NeMo PyTorch 框架上,想上 GPU 加速还要自己折腾 ONNX 转换。每换一个模型家族,就要重写一遍部署管线。

    ![transcribe.cpp:一个 ggml 运行时跑完 16 个语音转文字模型家族](https://linlog.top/api/uploads/2026/07/1784455686554308297-5811c1bd071

    GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口
    GPT-5.6用一段十页提示词,关闭凸优化30年的复杂性缺口

    2026 年 7 月 10 日,OpenAI 在自己的 CDN 上放出一篇 PDF,声称 GPT-5.6 Sol Ultra 用 64 个并行子代理、不到一小时,证明了图论里悬挂了 50 年的 Cycle Double Cover 猜想。数学界在震动与质疑中展开了审阅。六天后,UC Berkeley IEOR 教授 Phillip Kerger 把 OpenAI 公开的「CDC prompt」拿来,改造成了针对另一个问题的十页提示词,喂给 GPT-5.6 Sol Pro。148 分钟后,模型返回了一个凸优化下界的完整证明——一个他自己琢磨了一年、和 GPT-5.4/5.5 反复试都没能拿下的结

    Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS
    Moonshine Micro:80美分芯片跑完整语音流水线,500KB内存装下VAD+STT+TTS

    一块售价 80 美分、SRAM 只有 520 KiB 的微控制器能干什么?Pete Warden 给出的答案是:跑完一条完整的语音交互流水线——语音活动检测(VAD)、语音识别(STT)、神经文本转语音(TTS),全部在端侧完成,不联网、不调云 API、不需要账号或密钥。这个名为 Moonshine Micro 的开源项目本周登顶 Hacker News,把「80 美分芯片 + 不到 500 KiB RAM 跑完整语音界面」

    LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧
    LingBot-Map:用前馈3D基础模型做流式重建,20FPS跑完一万帧
    LingBot-Map:用前馈 3D 基础模型做流式重建,20 FPS 跑完一万帧

    把一段手持相机的视频丢进去,模型在 20 FPS 下边读帧边吐出相机位姿和稠密点云,序列超过一万帧也不崩——这是 Robbyant 团队开源的 LingBot-Map 交出的成绩单。它在 GitHub Trending 上日增 star 超 800,论文《Geometric Context Transformer for Streaming 3D Reconstruction》(arXiv:2604.14141)在 Oxford Spires、ETH3D、7-Scenes、Tanks and Temple

    B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴
    B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴
    B站在WAIC展出开源AI猫娘:能看懂屏幕、主动搭话的桌面伙伴

    7月17日至20日,2026世界人工智能大会(WAIC)在上海举行。在B站展台区域,一个名为「猫娘计划」(Project N.E.K.O.)的开源AI数字生命项目引起围观。需要先澄清一个容易误读的点:猫娘计划不是B站官方产品,而是B站UP主「W博士」(运营主体为喵可智能)主导的开源项目,它作为参赛作品出现在B站AI创造公开赛的展示区。

    N.E.K.O. 全称 Networked Emotional Knowledging Organism(网络型情感知性生命体),定位是一款主动式、原生全模态AI伙伴驱动器