字节跳动
港大联合字节跳动提出JoVA: 一种基于联合自注意力的视频-音频联合生成模型
作者介绍:本文第一作者黄小虎同学,目前是香港大学的三年级在读博士生,导师是韩锴教授。 黄小虎的研究方向是以视频为中心的领域,包括音视频生成、视频理解以及视频识别。 视频 - 音频联合生成的研究近期在开源与闭源社区都备受关注,其中,如何生成音视频对齐的内容是研究的重点。
输入分镜脚本,几秒生成1分钟连贯叙事视频!字节开源StoryMem,让AI视频角色永不“变脸”
近日,字节跳动与南洋理工大学联合研发的开源框架StoryMem在AI视频生成领域引发广泛关注。 该框架通过创新的“视觉记忆”机制,将现有单镜头视频扩散模型转化为多镜头长视频故事讲述者,能自动生成时长超过1分钟、包含多个镜头切换、角色和场景高度连贯的叙事视频,标志着开源AI视频技术向电影级叙事迈出关键一步。 StoryMem的核心创新:记忆机制驱动的逐镜生成StoryMem的核心在于引入人类记忆启发的“Memory-to-Video(M2V)”设计。
实测字节Seedance 1.5 Pro,能直出方言的AI视频也来了!
火山Force原动力大会掏了很多有意思的新货出来,但我觉得最炸的,还是他们的新视频模型,Seedance 1.5 Pro。 因为这次的更新,真的做到了影视级别的音画同步,而且中文能力和方言能力是目前所有模型里的独一档。 语音生成能力这点在他们的技术报告里也有体现。
硬刚豆包!联想 CES 战略级 AI 曝光:打通 PC 手机生态的“超级智能体”来了
据 AIbase 报道,联想集团计划在即将举行的 CES 期间,正式发布首款面向全球市场的战略级应用——“AI超级智能体”。 这一动作标志着联想在 AI 应用层面的全面发力,其目标直指字节跳动近期热议的“豆包手机助手”。 尽管该智能体的官方名称尚未公布,但从接近联想的知情人士处获悉,其功能复杂度与生态协同能力较豆包更为强悍。
字节 Seed 新模型问世:数学竞赛金牌实力爆表,AI 推理迈入新阶段!
近日,字节跳动旗下的 Seed AI 团队发布了一款名为 Seed Prover1.5的数学推理模型,该模型在国际数学奥林匹克(IMO)比赛中表现卓越,成功获得金牌,标志着人工智能在数学领域的又一突破。 Seed Prover1.5采用了 Scaling Law 理论,并在16.5小时内解决了 IMO2025的前五道题,仅失一题,最终以35分的成绩达到了金牌标准。 这一成绩与谷歌 Gemini 并驾齐驱,而字节之前的模型在当时需用三天才完成四道题,最终仅获得银牌。
消息称豆包日活已破 1 亿,系字节“亿级 App”产品中花费最低
AI在线 12 月 24 日消息,36 氪今日发布消息称,豆包的日均活跃用户数(DAU)已突破 1 亿大关,字节跳动 App 王国里“亿级 DAU”产品再添一子。 该媒体称,经多方求证,这一数据属实。 据字节内部人士透露,豆包的 UG、市场推广费用,是字节历史上,所有破亿 DAU 产品中花费最低的。
中兴押注AI手机!携手字节推“豆包手机”,开放生态或迎多模型共存时代
在智能手机创新见顶的当下,AI正成为破局关键。 近日,中兴通讯与字节跳动联合打造的“豆包手机”引发行业高度关注。 中兴内部人士向AIbase透露,选择字节跳动作为首发AI合作伙伴,源于双方对“AI手机是确定性未来”的共识,更基于“开放即创新”的核心理念。
字节跳动发布 Seed Prover1.5:推动形式化数学推理的新进展
近日,字节跳动 Seed 团队推出了其最新的形式化数学推理模型 Seed Prover1.5,标志着在数学推理领域的一次重要突破。 此次模型的推出,得益于对大规模 Agentic 强化学习的深入探索,使得其在推理能力和效率方面都取得了显著提升。 在参加2025年国际数学奥林匹克(IMO)比赛时,Seed Prover 展现了其强大的性能。
字节跳动发布新一代形式化数学推理专用模型 Seed Prover 1.5
AI在线 12 月 24 日消息,字节跳动 Seed 团队今日宣布推出新一代形式化数学推理专用模型 Seed Prover 1.5,通过大规模的 Agentic RL 训练,其推理能力和推理效率宣称取得显著进步。 相比上一代模型,Seed Prover 1.5 在 16.5 小时内,针对 IMO 2025 的前 5 道题目生成了完整可编译验证的 Lean 证明代码,换算成绩为 35/42,达到此前 IMO 评分标准的金牌分数线。 针对北美本科级别数学竞赛 Putnam,Seed Prover 1.5 用时 9 小时,对 12 道 Putnam 2025 赛题中的 11 道生成了可编译验证的 Lean 代码。
从红包大战到 AI 对决:火山引擎或成为2026春晚独家合作伙伴
互联网巨头字节跳动正试图复制当年微信、支付宝的“破局”神话。 据《晚点 LatePost》独家爆料,字节跳动旗下的火山引擎已正式敲定成为2026年中央广播电视总台春节联欢晚会的独家 AI 云合作伙伴,旗下智能助手“豆包”也将深度参与,上线多种 AI 互动玩法。 作为国民级超级 IP,春晚历来是顶级互联网产品谋求爆发式增长的关键战场。
消息称字节跳动拟豪掷230亿美元布局 AI 基础设施
为了在人工智能领域缩短与美国科技巨头的差距,字节跳动正在大幅上调其 AI 投资预算。 据《金融时报》及多方知情人士透露,字节跳动已初步制定2026年的资本支出计划,预计投入约 230亿美元(约合1600亿元人民币)用于 AI 基础设施建设,较2025年预期的1500亿元人民币进一步扩张。 在总预算中,约有一半(约850亿元人民币)将专门用于采购先进半导体制程的 AI 处理器。
联想携手字节跳动推进 AI 手机合作,内部揭示更多业务动态
最近,联想与字节跳动的合作引发了广泛关注。 根据媒体报道,字节跳动正在加快与包括 vivo、联想、传音等在内的硬件厂商进行 AI 手机的合作,目的是在这些设备上预装 AIGC 插件,从而提升用户的使用体验和获取入口。 这一举措旨在改变 AI 在实际应用中的被动局面,进而拓展市场。
豆包上线 Seedance 1.5 Pro,可直接生成有声视频
字节跳动新一代音视频创作模型 “Seedance1.5Pro” 正式登陆豆包,为普通用户打开了 “零门槛做有声视频” 的新体验。 这次上线的 Seedance1.5Pro,核心是把 “文字 - 画面 - 声音” 的创作链路做了一体化升级:语义 音画同步:不再是先出画面再配声音,模型能深度理解文本意图,同步生成匹配内容的画面与音效、台词,避免 “音画脱节”;更自然的 “开口说话”:生成的人物台词不再是机械合成音,语气、节奏更贴近真人表达;电影感叙事 动态镜头:画面会自带景别切换、运镜效果,复杂动作(比如人物的肢体互动)也能被精准捕捉,不用再手动调特效。 普通用户的操作也很简单:打开豆包 App 对话框,点击 “照片动起来” 功能,选择 “1.5Pro” 模型,上传一张参考图(比如自己的生活照、手绘草稿),再输入提示词(比如 “让这只猫用温柔的语气讲睡前故事,背景是星空卧室”),就能直接生成一条完整的有声视频。
字节跳动 AI 手机合作方案曝光,免收 Token 分成开启“让利换入口”
据界面报道,字节跳动正积极推进与 vivo、联想、传音等头部硬件厂商的 AI 手机深度合作,计划通过在设备操作系统层面预装 AIGC 插件(如“豆包手机助手”),以此攫取至关重要的 AI 流量入口,并扭转目前大模型在执行层面的被动局面。 多位 vivo 内部员工已证实双方确认合作,正在商讨落地细节。 此次合作的核心在于字节跳动开出了极具诱惑力的“分成方案”。
火山引擎相关人士回应“豆包比价”是否会提高字节产品权重:不会
AI在线 12 月 18 日消息,据搜狐科技,在今天的火山引擎 FORCE 原动力大会后,火山引擎相关人士对“豆包大模型在调用 App 的时候是否会提高字节产品权重”作出回应:“不会提高字节产品权重,AI 完全基于用户指令执行任务。 ”这名相关人士以豆包手机的演示 demo 为例解释说:“豆包手机助手的发布视频中,比价结果选择的是拼多多。 都是 AI 比出来的,没有人为干预。
告别抽卡!一手实测字节刚放出的视频模型Seedance 1.5 pro
编辑|杜伟、杨文结果在2025年底,视频生成再次热闹起来,多个新模型接连登场。 我们发现,在国内的头部厂商中,火山发动机的豆包系列视频生成模型已经很长时间没有大的版本更新了。 前代 Seedance 1.0 pro 的问世已经过去半年时间了,这也让我们对其下一代 Seedance 1.5 的关注度越来越高。
字节跳动推出 TRAE CN 企业版,助力高效编程
字节跳动正式发布了其 AI 编程工具 TRAE CN 的企业版。 这款工具在字节内部已经获得了超过92% 的工程师的使用,显示出其强大的实用性。 同时,个人版的注册用户也已经突破了600万。
字节跳动发布 Seedance 1.5 Pro:AI 音视频创作进入 100% 视听同步时代!
12月16日,字节跳动在北京正式发布了其新一代音视频创作模型 ——Seedance1.5pro。 这一全新的创作工具不仅在音视频生成领域实现了重大突破,还为用户带来了更为丰富的视听体验。 Seedance1.5pro 支持音视频的联合生成,用户可以通过文本输入生成音视频内容,或者利用图像引导生成音视频。
资讯热榜
标签云
AI
人工智能
OpenAI
AIGC
模型
ChatGPT
谷歌
DeepSeek
AI绘画
AI新词
大模型
机器人
数据
Midjourney
开源
Meta
微软
智能
用户
GPT
学习
智能体
技术
Gemini
英伟达
马斯克
Anthropic
图像
AI创作
训练
LLM
论文
代码
AI for Science
腾讯
苹果
算法
Agent
Claude
芯片
Stable Diffusion
具身智能
xAI
蛋白质
开发者
人形机器人
生成式
神经网络
机器学习
AI视频
3D
RAG
大语言模型
字节跳动
Sora
百度
研究
GPU
生成
工具
华为
AGI
计算
AI设计
生成式AI
大型语言模型
搜索
视频生成
亚马逊
特斯拉
AI模型
DeepMind
场景
深度学习
Copilot
Transformer
架构
MCP
编程
视觉