AI刀下留人:你敢让机器人做手术吗?

手术刀已交给 AI:你准备好了吗?

🚀 谷歌发布小模型 Gemma 2 2B

🔍 arXiv 论文讨论平台 AlphaXiv 上线

🤖 AI 达芬奇机器人自主完成外科手术任务

🤔 贾扬清:大模型重走 CNN 老路

🎬 我国自研视频大模型 Vidu 全球上线

🔍 中山大学与美团联手突破开放域物体检测技术

💰 AI 销售助手 Sybill 融资 1100 万美元

💰 Vanta 获 1.5 亿美元 C 轮融资

🚫 马斯克否认 xAI 收购 Character.AI 传闻

谷歌发布小模型 Gemma 2 2B

谷歌 DeepMind 推出了 Gemma 2 2B[1] 小模型,这是从 Gemma 2 27B 中蒸馏而来的轻量级模型。尽管只有 2.6B 参数,Gemma 2 2B 在 LMSYS 竞技场上的得分已超越 GPT-3.5 和 Mixtral 8x7B,在 MMLU 和 MBPP 基准测试中分别取得 56.1 和 36.6 的优异成绩,比前代模型性能提升超过 10%。

Gemma 2 2B 可在各种终端设备上部署,包括手机、笔记本和云平台。 它通过 NVIDIA TensorRT-LLM 优化,支持多种平台和框架,如 Keras、JAX、Hugging Face 等。开发者可从 Kaggle、Hugging Face、Vertex AI Model Garden 下载模型权重,或在 Google AI Studio 试用。此外,谷歌还发布了 ShieldGemma 安全内容分类器和 Gemma Scope 可解释性工具,进一步增强了 Gemma 2 家族的功能。

arXiv 论文讨论平台 AlphaXiv 上线

斯坦福大学计算机系学生开发的论文开放讨论平台 AlphaXiv[2] 正式上线,引发学术圈轰动。该平台允许用户对 arXiv 上的任意论文进行提问和讨论,只需将 URL 中的「arXiv」替换为「AlphaXiv」,或使用浏览器插件即可访问。

AlphaXiv 提供多种评论类型,包括一般性问题、研究见解、相关资源链接和私人笔记。 用户可以申请成为特定领域的评审员,主持讨论并投票选出特色论文。为促进互动,平台还设立了「每周论文」活动,要求入选论文作者在一周内回复所有评论。

该项目由吴恩达实验室的两位学生 Rehaan Ahmad 和 Raj Palleti 创建,最初作为网页开发课程的期末作业。项目得到了包括 Sebastian Thrun 在内的多位业内大佬的支持。

AI 达芬奇机器人自主完成外科手术

斯坦福和约翰霍普金斯大学研究团队成功让达芬奇手术机器人通过模仿学习掌握基本外科技能。机器人能够自主完成组织操作、针头处理和缝合打结等任务,无需人工干预。

研究人员克服了达芬奇系统特有的挑战,引入相对动作公式来训练策略。实验表明,该方法不仅能有效学习复杂手术任务,还能推广到新场景。机器人展现出零样本泛化能力,可以在未知动物组织上操作,并能应对环境扰动。

研究团队还进行了重复性测试,证明了AI 达芬奇在不同视角下的操作稳定性。他们使用内窥镜和手腕相机图像作为输入来训练策略,而非依赖不稳定的运动学数据。这种方法显著提高了手术任务的成功率,为未来临床应用奠定了基础。

贾扬清:大模型重走 CNN 老路

贾扬清观察到大模型尺寸变化正在重走 CNN 的发展路径。他在 X 的一条推文[3]中指出,行业正从追求更大规模转向更小、更高效的模型。 这一趋势与 CNN 在 ImageNet 时代的发展相似,先经历参数规模快速增长,后转向更小型高效模型。

卡帕西和马斯克也持相似观点。卡帕西认为模型需要先变大再变小,以重构训练数据。他预测未来会出现参数规模小但性能优秀的模型。贾扬清表示,7B-70B 参数规模的模型更易托管和盈利,且能提供不错的输出质量。

然而,也有不同声音。有人指出顶级 AI 公司仍在开发更大模型。对此,贾扬清解释说他的观点不是要停止大模型训练,而是强调业界开始关注性价比更高的模型。这一趋势可能挑战「越大越好」的假设,重新定义 AI 的「智能」。

我国自研视频大模型 Vidu 全球上线

清华大学与北京生数科技联合研发的通用视频大模型 Vidu[4] 正式面向全球上线。**Vidu 支持文生视频和图生视频功能,可生成 4 秒或 8 秒的高清视频,最高分辨率达 1080P。**该模型具有「长时长、高一致性、高动态性」的特点,能模拟真实物理世界,生成符合物理规律的复杂场景。

Vidu 支持多种电影风格和特效画面生成,可实现不同镜头的切换和复杂动态镜头的创作。除基础功能外,Vidu 还推出「动漫风格」和「角色一致性」新功能,提升用户的创作自由度。用户只需使用邮箱注册即可体验 Vidu 的强大功能。

Vidu 的核心技术架构源于研发团队在机器学习和多模态大模型方面的长期积累。该模型可支持一次性生成最长 32 秒的视频,在动态性方面表现出色,能生成复杂动态镜头和精准的动作。

中山大学与美团联手突破开放域物体检测技术

中山大学携手美团推出了新一代开放域物体检测模型 OV-DINO[5],在性能上大幅领先现有技术。这项突破使得 AI 系统能更灵活地识别和定位各种物体,无需预先定义固定的类别。

OV-DINO 模型采用创新的语言感知技术,能够理解文字描述并在图像中精准定位相应物体。在权威的 COCO 和 LVIS 数据集测试中,OV-DINO 展现出卓越的检测能力,特别是在处理未见过的物体类别时表现突出。

研究团队已开源相关代码和论文,并提供在线演示。这一进展为计算机视觉领域带来新的可能性,有望在安防、自动驾驶、智能零售等多个领域得到广泛应用。尽管仍面临一些技术挑战,OV-DINO 的出现无疑为开放域物体检测开辟了新的研究方向。

AI 销售助手 Sybill 融资 1100 万美元

Sybill[6] 完成由 Greycroft 领投的 1100 万美元 A 轮融资,累计融资达 1450 万美元。该公司开发的 AI 销售助手能分析通话和邮件,提供上下文洞察和总结,每周为销售代表节省 5 小时以上时间。

Sybill 基于 GPT 模型构建了内部 RAG,可记录销售对话、提供摘要、起草邮件、更新 CRM 等。公司瞄准销售人员而非领导层,9 个月内 ARR 从 10 万美元增至 100 万美元,已拥有 500 多个付费客户团队。

Sybill 计划利用新资金进一步开发 AI 助手并扩大团队规模。在当前科技行业放缓背景下,Sybill 帮助企业提高销售效率的产品获得了良好发展势头。

Vanta 获 1.5 亿美元 C 轮融资

Vanta[7] 近日获得红杉资本领投的 1.5 亿美元 C 轮融资,估值达 24.5 亿美元。高盛、摩根大通等新投资者和多家现有投资者参与本轮融资。Vanta 累计融资额达 3.53 亿美元,旨在成为 AI 驱动的全能企业信任管理平台。

Vanta 成立于 2018 年,最初专注于自动化合规,帮助企业快速获得各类认证。随着全球监管环境变化和 AI 发展带来的风险加剧,Vanta 业务不断扩展,通过提供专家服务和自动化工具,简化了安全和合规流程,可自动化高达 90% 的审计准备工作。

Vanta 的主要产品包括 Vanta AI、供应商风险管理和 Vanta 信任中心。Vanta AI 提供 AI 驱动的供应商安全评估和智能控制映射等功能。供应商风险管理帮助客户管理第三方应用程序风险。Vanta 信任中心则是展示安全性和合规性的平台。

马斯克否认收购 Character.AI 传闻

埃隆·马斯克在 X 平台上否认了 xAI 考虑收购 AI 聊天机器人初创公司 Character.AI 的传言。此前有媒体报道称,xAI 正在考虑收购 Character.AI,以寻找更多方法测试其 Grok AI 模型。

马斯克于 2023 年成立 xAI,推出了对标 ChatGPT 的聊天机器人 Grok。xAI 最近获得 60 亿美元 B 轮融资,估值超 240 亿美元。Character.AI 由谷歌前员工创立,允许用户创建和定制各种虚拟角色,去年估值超 50 亿美元。

马斯克曾在 X 上发起投票,询问特斯拉是否应向 xAI 投资 50 亿美元,并提出将 xAI 技术整合到特斯拉自动驾驶功能中的可能性。尽管有收购传闻,但马斯克明确表示 xAI 目前不考虑收购 Character.AI。

你必须不再渴望拥有一个更好的过去。

—— 《生命的礼物》

编辑团队 编辑:Ziwen

设计:Ivan

商务合作请加微信:Rwkfbcianvd

参考资料 [1] Gemma 2 2B: https://huggingface.co/google/gemma-2-2b

[2] AlphaXiv: https://alphaxiv.org/

[3] 推文: https://x.com/jiayq/status/1818786673695809793

[4] Vidu: https://www.vidu.studio

[5] OV-DINO: https://arxiv.org/abs/2407.07844

[6] Sybill: https://www.sybill.ai/

[7] Vanta: https://www.vanta.com/