TensorX

Explore · 每周精选

发现最受关注的研究论文,追踪研究趋势,订阅感兴趣的期刊与关键词。

May 29 – Jun 4, 2023

50 篇论文 · 按点赞排序

35

Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation

Jiawei Huang, Yi Ren, Rongjie Huang +7 authors

Make-an-Audio 2, a latent diffusion-based text-to-audio synthesis method, improves semantic alignment and temporal consistency through pre-trained language models, structured-text encoding, a Transformer-based diffusion denoiser, and data augmentation.

4latent diffusiontext-to-audio (T2A)HF ↗arXiv ↗
36

Controllable Text-to-Image Generation with GPT-4

Tianjun Zhang, Yi Zhang, Vibhav Vineet +2 authors

Control-GPT enhances text-to-image generation by using GPT-4-generated TikZ sketches as guides, improving spatial arrangement and object positioning accuracy.

4diffusion-based text-to-imageControlNetHF ↗arXiv ↗
37

Fine-Tuning Language Models with Just Forward Passes

Sadhika Malladi, Tianyu Gao, Eshaan Nichani +4 authors

MeZO, a memory-efficient zeroth-order optimizer, fine-tunes large language models with significantly reduced memory usage while maintaining performance comparable to backpropagation.

4zeroth-order methodsZO-SGDHF ↗arXiv ↗
40

Photoswap: Personalized Subject Swapping in Images

Jing Gu, Yilin Wang, Nanxuan Zhao +8 authors

Photoswap enables seamless subject swapping in images using pre-trained diffusion models with self-attention and cross-attention manipulation, preserving pose and coherence.

4diffusion modelsself-attentionHF ↗arXiv ↗
45

Mindstorms in Natural Language-Based Societies of Mind

Mingchen Zhuge, Haozhe Liu, Francesco Faccio +23 authors

Natural language-based societies of minds (NLSOMs) consisting of diverse neural network experts improve multimodal zero-shot reasoning and can solve various practical AI tasks by communicating through a universal symbolic language.

4society of mindlearning to thinkHF ↗arXiv ↗
47

Large Language Models as Tool Makers

Tianle Cai, Xuezhi Wang, Tengyu Ma +2 authors

A proposed framework, LATM, allows large language models (LLMs) to create and use their own tools for problem-solving, enhancing efficiency and cost-effectiveness.

4LLMstool makingHF ↗arXiv ↗
48

Inserting Anybody in Diffusion Models via Celeb Basis

Ge Yuan, Xiaodong Cun, Yong Zhang +5 authors

A novel method personalizes pre-trained diffusion models using minimal data and parameters, enabling high-quality image generation of new identities and interactions.

3pretrained large text-to-image modelStable DiffusionHF ↗arXiv ↗
50

Understanding and Mitigating Copying in Diffusion Models

Gowthami Somepalli, Vasu Singla, Micah Goldblum +2 authors

Text-to-image diffusion models, such as Stable Diffusion, frequently replicate training data during inference, especially with text conditioning; proposed techniques address this by randomizing and augmenting image captions.

3diffusion modelstext-to-imageHF ↗arXiv ↗
2 / 2

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号