图像模型
谷歌测试 Nano Banana2Flash 图像模型,主打极致速度与高性价比
继发布高端图像模型 Nano Banana Pro 后,谷歌正秘密测试其 Gemini Flash 系列的新成员——Nano Banana2Flash。 该模型由知名科技博主 MarsForTech 在 X 平台上率先曝光,作为谷歌目前速度最快的生成式 AI 图像模型,它旨在为用户提供更实惠、更高效的视觉生成体验。 虽然在推理深度、细节精确度以及处理极其复杂的创意任务(如精密原型图或高精度图表)方面,Nano Banana2Flash 的性能上限不及定位高端的 Nano Banana Pro,但它继承了 Pro 版本对现实世界知识的理解能力,并显著优化了生成逻辑。
腾讯混元图像 2.0 模型发布:毫秒级响应,一边打字一边出图
在同类商业产品每张图推理速度需要 5 到 10 秒的情况下,腾讯混元号称可实现毫秒级响应,支持用户可以一边打字或者一边说话一边出图,改变了传统“抽卡 — 等待 — 抽卡”的方式。
Meta 推 WebSSL 模型:探索 AI 无语言视觉学习,纯图训练媲美 OpenAI CLIP
科技媒体 marktechpost 发布博文,报道称 Meta 公司发布 WebSSL 系列模型,参数规模从 3 亿到 70 亿,基于纯图像数据训练,旨在探索无语言监督的视觉自监督学习(SSL)的潜力。 以 OpenAI 的 CLIP 为代表,对比语言-图像模型已成为学习视觉表征的默认选择,在视觉问答(VQA)和文档理解等多模态任务中表现突出。 不过受到数据集获取的复杂性和数据规模的限制,语言依赖面临诸多挑战。
资讯热榜
标签云
AI
人工智能
OpenAI
AIGC
模型
ChatGPT
谷歌
DeepSeek
AI新词
AI绘画
大模型
机器人
数据
Midjourney
开源
Meta
微软
智能
用户
GPT
学习
英伟达
Gemini
智能体
技术
马斯克
Anthropic
图像
AI创作
训练
LLM
论文
AI for Science
代码
腾讯
苹果
算法
Agent
Claude
芯片
具身智能
Stable Diffusion
xAI
蛋白质
人形机器人
开发者
生成式
神经网络
机器学习
AI视频
3D
字节跳动
大语言模型
RAG
Sora
百度
研究
GPU
生成
华为
工具
AGI
计算
生成式AI
AI设计
大型语言模型
搜索
亚马逊
AI模型
视频生成
特斯拉
DeepMind
场景
Copilot
深度学习
Transformer
架构
MCP
编程
视觉