Pith. sign in

Paper Citation Record · LEDGER

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers

As of 13 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2607.23811.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.23811 v1

Coverage vector

measured 20 of 20 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-30T11:48:49.534136Z

measured 20 of 20 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

20 of 20 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e21cd542-a294-44d8-934b-7df81d036d3f · outbound

This paper cites MusicLM: Generating Music From Text.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers MusicLM: Generating Music From Text

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.415516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.415516Z digest=sha256:1d2dbd2cda5e2da4f40846664897915b953275816cddea858f82632368f76561

Observation b2454572-4142-42e8-ad1e-0287e74a13f0 · outbound

This paper cites com/deepmind-media/gemma/gemma-2-report.pdf.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers com/deepmind-media/gemma/gemma-2-report.pdf

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.477289Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.477289Z digest=sha256:5af3a67b22e48eb1f4b286bdd9f6ba3f543509537eeff0ed09fd182b19a6fd8b

Observation 0b2fa850-bb71-4998-8e76-cabf201c68f4 · outbound

This paper cites AudioGen: Textually Guided Audio Generation.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers AudioGen: Textually Guided Audio Generation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.491314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.491314Z digest=sha256:e90ffd8b7fe09f84f13401ee4ad2153870c763cc3a640750fcc31b6bb494d1a9

Observation 2df537a7-7fdf-4fd9-b00b-816a65adfb4b · outbound

This paper cites Chunked Autoregressive GAN for Conditional Waveform Synthesis.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Chunked Autoregressive GAN for Conditional Waveform Synthesis

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.506021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.506021Z digest=sha256:a2a749558af43bf0aeb6b53514944bdabb867f87cec8396d11d3ca4272bcfbe2

Observation c6ed2877-ded8-4e06-8f7b-fca3dad09f39 · outbound

This paper cites Librispeech: An asr corpus based on public domain audio books.2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 5206–5210,.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Librispeech: An asr corpus based on public domain audio books.2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 5206–5210,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.509573Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.509573Z digest=sha256:f61d9cb7378b8b6e6134d96de2861d319756ee8a83d20f04cc7ff7358aeb5037

Observation e00c8b65-13fc-4ce9-9780-4d7741398f39 · outbound

This paper cites Eval- uating speech features with the minimal-pair abx task: analysis of the classical mfc/plp pipeline.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Eval- uating speech features with the minimal-pair abx task: analysis of the classical mfc/plp pipeline

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.515999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.515999Z digest=sha256:d651d75fd88082593f161e5b370fb2c9f579a08d0ad76e259a066bbed538f7c0

Observation 26515f14-db05-481a-9502-5459cc5e519f · outbound

This paper cites GLU Variants Improve Transformer.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers GLU Variants Improve Transformer

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.522615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.522615Z digest=sha256:688c0ec79b499231941254a4d3b9d76608e309080d4c410a97ba372378815e21

Observation e039e130-9fc9-4b33-afdd-ef05a5bfedf3 · outbound

This paper cites TS3-Codec: Transformer-Based Simple Streaming Single Codec.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers TS3-Codec: Transformer-Based Simple Streaming Single Codec

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.526693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.526693Z digest=sha256:a0bb153fc2b21e4e61455add618a1237c2afd9dc3490fb2b9ac25d07db015d2d

Observation 4592ddbd-ab3b-4b57-befd-05ec2ee93192 · outbound

This paper cites Biao Zhang and Rico Sennrich.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Biao Zhang and Rico Sennrich

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.530312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.530312Z digest=sha256:0e333bca600beb64159a008a277fabc0c0f46c460095688cf7c816bc9d4e4939

Observation 20638a92-3a74-4b07-9690-c58b1bf289b6 · outbound

This paper cites Root Mean Square Layer Normalization.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Root Mean Square Layer Normalization

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.534136Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.534136Z digest=sha256:3c0863a5d5c58a3bb26ee3cf4d6ab2d7bd69232f5f33f8b0fda7cabb620857e7

Observation 389770ee-ba4d-44f0-a81c-53148c577d9f · outbound

This paper cites William Peebles and Saining Xie.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers William Peebles and Saining Xie

Reference 2015

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.512738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.512738Z digest=sha256:fb04216e546985a69d1c448cb15d276902e01850df7af9bbd96ae9afa457aa31

Observation c827519a-d409-4fad-8d7a-dbe151ca1f16 · outbound

This paper cites DiffWave: A Versatile Diffusion Model for Audio Synthesis.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers DiffWave: A Versatile Diffusion Model for Audio Synthesis

Reference 2018

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.487060Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.487060Z digest=sha256:0dc1b8cb8effd277bdc77f51354308b67a547532d402916aac839a0ee1542883

Observation 6e732adf-c477-44e6-9729-136ae39cab44 · outbound

This paper cites MOSNet: Deep Learning based Objective Assessment for Voice Conversion.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers MOSNet: Deep Learning based Objective Assessment for Voice Conversion

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.502742Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.502742Z digest=sha256:8c9509eff3b298581031308a29e6ab6525628af41c23dd3624c49726e4f41629

Observation 5e9069ad-1b4b-4e21-b525-e7855bc98209 · outbound

This paper cites Longformer: The Long-Document Transformer.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Longformer: The Long-Document Transformer

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.434595Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.434595Z digest=sha256:ee26dbfa8d0e5f42f30f330c312b4ba324b1198d7a28af6f27f0a897e277c887

Observation d0504c5b-bbea-47b6-a591-41777f8f3a14 · outbound

This paper cites Generative Spoken Language Modeling from Raw Audio.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Generative Spoken Language Modeling from Raw Audio

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.494905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.494905Z digest=sha256:43d156fb949f3e664e86600db915af9cc2044ccfa2db2abd640f33224b2442b2

Observation 7db42bbe-1d03-45a6-8ca0-0af55c59bc70 · outbound

This paper cites High Fidelity Neural Audio Compression.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers High Fidelity Neural Audio Compression

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.461058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.461058Z digest=sha256:514810959e76edff2695fde33e191f330bd5e1b95fe95092c75e8b2c045945f9

Observation 221537d4-7c66-4dc0-9ef5-949e125132b2 · outbound

This paper cites Moshi: a speech-text foundation model for real-time dialogue.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Moshi: a speech-text foundation model for real-time dialogue

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.443774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.443774Z digest=sha256:27b6d3df011fd0f689b3decb412f44f159751940e3c516b438280b4d22e5a913

Observation 7b841039-5eab-4ab0-9bfe-e88eaec1fdba · outbound

This paper cites Jukebox: A Generative Model for Music.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Jukebox: A Generative Model for Music

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.452676Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.452676Z digest=sha256:cc35973edfa3894d29e8f158e3622d562ff9754e6e44fbcad033d94ef39938b6

Observation 9f2d315c-a744-44a2-b2e3-7246a5d8d1a6 · outbound

This paper cites Instruction-Following Pruning for Large Language Models.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Instruction-Following Pruning for Large Language Models

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.482980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.482980Z digest=sha256:8de7e7bbf61a080add65d8e4ee9300d8edce47fbf77f228d59518a52c201d613

Observation 9a48891d-6705-4140-862d-2ffea9aa6f28 · outbound

This paper cites an unresolved cited work.

Memory Efficient Audio Synthesis with Decoupled Temporal Depth Diffusion Transformers Unresolved cited work

Reference 2026

Resolution
unresolved
no resolver link, observed 2026-07-30T11:48:49.469480Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T11:48:49.469480Z digest=sha256:60d31edb0a8bdc7ce412059715cc0a342616dbfd7ef241086d4a26dec00cbcb3

Pith citing papers

No inbound Pith citation observations are available.