{"as_of":"2026-08-15T02:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b013c867eb49bd248ffb2a86556e685bba73bfee8ea49cd41f8e347deed4d3eb","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:19:02.457827Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00289/citation-record","integrity":"/paper/2508.00289/integrity","json":"/paper/2508.00289/citation-record.json","paper":"/paper/2508.00289"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T10:18:56.826240Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:56.826240Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:4b685cf6dd479a14f214369f153980e28e2ac024ba6fb909d6554e2c179fc7fa","observation_id":"61f32914-3bf4-4ef5-99a5-9ed11e27bdd0","resolution":{"observed_at":"2026-08-06T10:18:56.826240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:18:56.952634Z","title":"Universal guidance for diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:56.952634Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:28fbd954b6983784d1e8f8b650ea349fcc7419b115d7c2c1aa28ec0f5bed3328","observation_id":"97ff0b24-2483-4afe-b4c9-ff89109da48c","resolution":{"observed_at":"2026-08-06T10:18:56.952634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08587","last_updated":"2022-02-17T11:07:55Z","snapshot_observed_at":"2026-08-10T02:29:01.141729Z","submitted_at":"2022-02-17T11:07:55Z","title":"Gradients without Backpropagation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08587","snapshot_observed_at":"2026-08-06T10:18:57.082183Z","title":"Gradients without backprop- agation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.082183Z"},"links":{"cited_paper":"/paper/2202.08587","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:cc2d55ed9f587de187bb30ef91c6acff880f7c8ea72a3bae340c41e6a88b702b","observation_id":"65cb2da8-1ade-4ef7-9343-8835e291098a","resolution":{"observed_at":"2026-08-06T10:18:57.082183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:11.570992Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"fc6e2b96-cc54-47b1-a4ff-79603136c6f5","year":2020},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.192695Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:2df08346fbdab1bb21a784385c93e1ca58c2f3639410485b411d766837088434","observation_id":"5e741762-9efd-4d2e-9896-cd1944370230","resolution":{"observed_at":"2026-08-06T10:19:11.702942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T10:18:57.269811Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.269811Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:3545f0f1bb7358d58012e05493ed931b9738851449d3b163dad70febaea62b95","observation_id":"85c9296b-5c14-4974-a0a9-539afb891a64","resolution":{"observed_at":"2026-08-06T10:18:57.269811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-08-13T05:53:39.537622Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-08-06T10:18:57.439470Z","title":"Flatten: optical flow- guided attention for consistent text-to-video editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.439470Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:294c479a9f11a8200ff4b094f63d5c714d7abdff117f1cc5328a737051433d93","observation_id":"6613ac4e-a0ee-4d69-888d-5f7d6afcd8a9","resolution":{"observed_at":"2026-08-06T10:18:57.439470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:11.282651Z","title":"Tweedie’s formula and selection bias","venue":null,"work_id":"4faf1505-0878-414f-8c5e-e5886648b08e","year":2011},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.613325Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:38f7158484cd6afe00e38f8216b496c94b71aa06625adefb2d7985890c71e3ef","observation_id":"4794412c-6459-41b2-8565-d8ec71da7764","resolution":{"observed_at":"2026-08-06T10:19:11.424128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:11.042369Z","title":"Douceur, Jon Howell, and Jared Saul","venue":null,"work_id":"c8915c04-f4ce-49d4-b7e6-fc9afdb9f1d5","year":2007},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.724040Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:6caed456446d711804183673c90464a14238157015ec3ea800f70a75abddd202","observation_id":"e045067b-375a-4c81-9083-815f84451c25","resolution":{"observed_at":"2026-08-06T10:19:11.166560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:10.691149Z","title":"Can forward gra- dient match backpropagation? In International Conference on Machine Learning, pages 10249–10264","venue":null,"work_id":"ec88cd3c-e58d-4a95-8833-8f4d87005c16","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.821630Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:9d8221854c6232b2649d338920b8da4863d9f4db9f2aec652b783d7cd67f3be7","observation_id":"e1f4623e-a616-43d3-b1b2-ef71f27d9dbc","resolution":{"observed_at":"2026-08-06T10:19:10.878163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:10.424932Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":"525648c0-6949-4cd8-b320-9282d0bf544a","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:57.972339Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:f1bae1c5c28f7a1cd97b9010726b31fe3744975132c60bbe73eb0fef64dea971","observation_id":"780e7832-8161-4df9-8f09-8a3602faf2b3","resolution":{"observed_at":"2026-08-06T10:19:10.534267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:10.014025Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":"4ca7f84c-211a-4992-872d-ca80516d50b2","year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.085809Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:b3823713de94e0c813be2487cdea88730dbd1d5226817965a68e65f593361e42","observation_id":"353fe7c7-d430-439c-a0c6-2b15c9063727","resolution":{"observed_at":"2026-08-06T10:19:10.212799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:09.694773Z","title":"Manifold preserving guided diffusion","venue":null,"work_id":"646ed645-0324-41ce-84f0-60db5ececdfa","year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.205603Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:1315dbbc3689a24f4d8eef99bd101478be2e9a0de96db97a4ee61068772a0614","observation_id":"0c7c502e-e2ee-4244-aa30-ef2f52fa8d91","resolution":{"observed_at":"2026-08-06T10:19:09.868357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:09.395139Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"6999c5b8-cdb7-443a-89df-9d1312a9a157","year":2020},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.394471Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:dff4a4fbd1e54374e160c33bc1f9254494e4257b9de2a4b3f8102e1c0cc9c5e9","observation_id":"e5f97f8a-a3fc-42d4-af10-67abb484eccc","resolution":{"observed_at":"2026-08-06T10:19:09.502025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:09.129081Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":"3f505eeb-4a86-4ebc-b11b-73be84c53982","year":2015},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.564074Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:274dd4d793adfddf4a082feab010449ed544cc4740e238a77b1ce8e829918a21","observation_id":"ca448dae-a797-4ecf-91a5-667456f374ad","resolution":{"observed_at":"2026-08-06T10:19:09.273484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.01073","last_updated":"2022-01-05T00:07:35Z","snapshot_observed_at":"2026-08-14T03:40:56.071989Z","submitted_at":"2021-08-02T17:59:47Z","title":"SDEdit: Guided Image Synthesis and Editing with Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.01073","snapshot_observed_at":"2026-08-06T10:18:58.687765Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.687765Z"},"links":{"cited_paper":"/paper/2108.01073","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:6d4e77f84f4000ba946958bc59cba56254eb49cb87bc764e8f2259ffc6f55125","observation_id":"109e8f0a-ab82-41a2-97a5-9426a5050ddd","resolution":{"observed_at":"2026-08-06T10:18:58.687765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:18:58.787547Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.787547Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:3b40a910f539a4adde529eb42a993f691640b84b7bfcdd0dc4ee0eeeff0080d8","observation_id":"bc306bb7-b91a-4b83-871f-8e77b75dd7e2","resolution":{"observed_at":"2026-08-06T10:18:58.787547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:08.795332Z","title":"Patel, and Tim K","venue":null,"work_id":"8ed3b3be-2111-408b-b1e2-1a2e84d59554","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:58.894322Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:6c8a088ca2650a2c70171534bac0ce7dc76ee68da014573df6518d959a948770","observation_id":"f701c130-ba86-49e1-8dc5-720392997abb","resolution":{"observed_at":"2026-08-06T10:19:08.928742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:08.500284Z","title":"Steered diffusion: A generalized framework for plug- and-play conditional image synthesis","venue":null,"work_id":"f6229827-44b9-4294-a310-becc81471a47","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.035988Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:29f5460fa2ad265de544bb1e457c9cf5dcfa0ce54ba03b7fc0c02668a4c6d081","observation_id":"b664519c-6427-4068-9362-0873ec69e3ca","resolution":{"observed_at":"2026-08-06T10:19:08.636474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:08.113483Z","title":"Ditto: Diffusion inference-time t- optimization for music generation","venue":null,"work_id":"1b156a99-1673-4468-856b-ddc1700075cf","year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.138737Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:da4b961ceef99b464ad1a03951228b96f987e5a935d0e9d19b9d0cc3047ccdd1","observation_id":"84481e46-f891-4932-a068-bdd3f63dc99d","resolution":{"observed_at":"2026-08-06T10:19:08.310674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.824152Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"13cf78a7-3564-4102-a93b-5db7b16e65cf","year":2017},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.271633Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:ee728bc48530b921c4fb4edf9fa04e2457bfe975c5ad876fdb21371e7fbb1059","observation_id":"e8293c18-bbc8-4b46-83b0-03320f0856f9","resolution":{"observed_at":"2026-08-06T10:19:07.937331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.554089Z","title":"Styleclip: Text-driven manipulation of stylegan imagery","venue":null,"work_id":"9d44f7ff-406a-4f4b-88b7-cf530af7dbe7","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.412916Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:a0486d4a52b3cb6062a30d1e3990d2b46d328aba41c48cff7339ef27c368c54e","observation_id":"6f0f0cf5-2519-4903-bfe6-a7ba4f508d54","resolution":{"observed_at":"2026-08-06T10:19:07.673876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03310","last_updated":"2023-03-02T03:08:10Z","snapshot_observed_at":"2026-08-13T14:10:49.272103Z","submitted_at":"2022-10-07T03:52:27Z","title":"Scaling Forward Gradient With Local Losses","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03310","snapshot_observed_at":"2026-08-06T10:18:59.548616Z","title":"Scaling forward gradient with local losses","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.548616Z"},"links":{"cited_paper":"/paper/2210.03310","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:5f0bd5bf249315168962cfa47deec2abb660be9cd0f39c46db3f2f5c1192b1c5","observation_id":"f431413d-636f-4661-9c85-40a0ccca9d2d","resolution":{"observed_at":"2026-08-06T10:18:59.548616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T10:18:59.650703Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.650703Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:bb2c8b07e8b014ec365208468811ca695a5c91c866924299625fe02cd91ccf11","observation_id":"05ce7fb0-539f-4024-a778-1b7e3702cfcc","resolution":{"observed_at":"2026-08-06T10:18:59.650703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.278276Z","title":"Loss-guided diffusion models for plug-and-play controllable generation","venue":null,"work_id":"b1b2f1eb-f19c-4f1c-a8b7-eed90aeb0ed6","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.799031Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:8d21c3bc8a1001882b088da4ca5a4cfd2e34bbafde46953d91ce9635f39c2dbd","observation_id":"5b7dfdf3-f96a-4646-af6a-c4f7a011a005","resolution":{"observed_at":"2026-08-06T10:19:07.430315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T10:18:59.912795Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:18:59.912795Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:de88143449337a93b1992edd31c34aa39f2891e305f917b5eefcaf330ef0082c","observation_id":"d0929762-7452-4243-8153-6d1db2256879","resolution":{"observed_at":"2026-08-06T10:18:59.912795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-06T10:19:00.091556Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.091556Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:0897924d0763d4aa793651dd99892eee636939c5778b842a80aa4c91fa9ecef9","observation_id":"ed4047d1-92d2-4b7a-bcc7-8cc58542da2f","resolution":{"observed_at":"2026-08-06T10:19:00.091556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12446","last_updated":"2022-12-22T17:13:50Z","snapshot_observed_at":"2026-08-13T13:37:14.641156Z","submitted_at":"2022-11-22T18:02:49Z","title":"EDICT: Exact Diffusion Inversion via Coupled Transformations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12446","snapshot_observed_at":"2026-08-06T10:19:00.213508Z","title":"Edict: Ex- act diffusion inversion via coupled transformations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.213508Z"},"links":{"cited_paper":"/paper/2211.12446","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:dde4d2839a7b2948b001b6c0cf2250a6ee9506ff56ab26d29df94f02f0c9692c","observation_id":"3cc2f208-d7cc-4330-aaea-86349019cc39","resolution":{"observed_at":"2026-08-06T10:19:00.213508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:07.061484Z","title":"End-to-end diffusion latent optimization improves classifier guidance","venue":null,"work_id":"97b95c58-c1d0-4446-8b34-4f7dffeedb18","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.336983Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:2f1beb408b4f2bb14d620f0c07cd26fdb8480b86b34151ef27013d560ea6ee75","observation_id":"78aa970c-3d51-492f-99c1-2bbb2c9ab251","resolution":{"observed_at":"2026-08-06T10:19:07.137812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.622419Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"d2e8ccf7-de0b-4523-bd1b-62866f918154","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.614727Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:bce29d5727be169363ea5798a9e79248ada83649b5c1bf6becd8e236eacfefa5","observation_id":"99ed74fa-e27b-4e31-a287-b25c27dc2ee7","resolution":{"observed_at":"2026-08-06T10:19:06.744134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.331573Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"ed58322e-1d63-458a-9482-49f76656a083","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.710597Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:cbf1adfefdb8284b932849958170315794dc2fb9889480b1d4fc1f63ff415758","observation_id":"ea998301-69ef-477d-a762-6a86dd3169c6","resolution":{"observed_at":"2026-08-06T10:19:06.458827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.052991Z","title":"Cvpr 2023 text guided video editing competition, 2023","venue":null,"work_id":"c2e18bfa-5d07-4185-9dbd-3f6d60506248","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.838968Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:f588fa92536df7fa12f3d58c29a015985ed71353873b2bdb60d5711a617ceaef","observation_id":"8bec9df8-22b1-4dad-bf9e-1b9172dcf155","resolution":{"observed_at":"2026-08-06T10:19:06.190487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:05.791295Z","title":"Seeing and hearing: Open-domain visual- audio generation with diffusion latent aligners","venue":null,"work_id":"83244ec1-f7ea-4bde-91d4-da768055b3a0","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.953443Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:e49541c9128c40bd27ea1ac18e857e64d3897231bd165eda96c2324a1cc429fa","observation_id":"044e5235-c78a-4483-8093-2f2414993387","resolution":{"observed_at":"2026-08-06T10:19:05.917568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T10:19:01.037098Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.037098Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:48a9663438d3808f38eb950f97eef51624babffedf975d8585c1908bccb59796","observation_id":"25503311-d8e4-4b04-bb5f-b1719b6d39e0","resolution":{"observed_at":"2026-08-06T10:19:01.037098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:05.472445Z","title":"Diverse and aligned audio-to-video genera- tion via text-to-video model adaptation, 2023","venue":null,"work_id":"607c0efc-8383-4cae-9e20-f825ea29828a","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.163520Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:e317c7eb667e70d465adb20ba6cdc9bb9d7ec47c09a6c93f8dbfe75bb7d0157b","observation_id":"6167f9db-803e-41b5-8ee3-9628d404505e","resolution":{"observed_at":"2026-08-06T10:19:05.634407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:05.137210Z","title":"Tfg: Unified training-free guidance for diffusion models","venue":null,"work_id":"7c6f5b55-4a08-42a7-a2ce-cc8f3b63b88d","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.311418Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:74cde948a37e7cbf5959fc2b6db9c13ed6b4b1400f2edd06424ea794a6d5aa78","observation_id":"7cfc12ab-ee6c-498c-83d7-65717fb6f311","resolution":{"observed_at":"2026-08-06T10:19:05.321040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:04.482725Z","title":"Freedom: Training-free energy-guided condi- tional diffusion model","venue":null,"work_id":"6c5fddff-40b1-438e-be3c-8e4f3c71708b","year":2023},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.596884Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:021bfaec5f9bb5086c721fe160847e8c4d3e3cde519f09207b275c011fd3d2f5","observation_id":"f0c7fe81-8da2-4468-b3eb-380fd05c7921","resolution":{"observed_at":"2026-08-06T10:19:04.670407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:04.194457Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"d025c5a4-0749-4b50-b843-c205c3f5512f","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.748117Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:4674fecefcf70338b21deb9dcf56121d4774d44700e3031899382cbee03ff1d0","observation_id":"536b11ec-c3a9-494b-b212-70f0c23e8c2f","resolution":{"observed_at":"2026-08-06T10:19:04.314085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.954286Z","title":"Let f : Rm − →Rn","venue":null,"work_id":"a8063078-22e4-464d-8e79-bfadeb88ff00","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.905666Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:e039f8f4880e72739a5d7856c52872a43a2474dd479c5b6f6bd66d858c9a55fa","observation_id":"712f5a20-7764-4359-a4a4-f09137e3f6f0","resolution":{"observed_at":"2026-08-06T10:19:04.092191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.648059Z","title":"In all experiments, we em- ploy AnimateDiff [11] with epiCRealism 2 as the base text- to-image model to generate 16 frames 8fps","venue":null,"work_id":"a82ff1b0-e8ab-4efa-90a3-bd82977ac8ec","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.041513Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:3f80dec35cd1ab77e4e1c0d732f0cccd962813350c3216623c7e1bbad5996c60","observation_id":"497cee0c-5b7c-429f-bc98-83ce86c2c8f6","resolution":{"observed_at":"2026-08-06T10:19:03.806570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.344411Z","title":"A bird in a forest","venue":null,"work_id":"dad877d8-e820-4930-b2b2-680d0cabc298","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.169544Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:940c1da1405f3f1d384be337163327a2c58689f6ce3d711dbfd4e3aa2af38408","observation_id":"ad2b222c-fb6a-40cc-b1c5-8c00e1f73c1a","resolution":{"observed_at":"2026-08-06T10:19:03.496573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:03.136768Z","title":"However, since our primary focus is text- to-video tasks, we do not explore this aspect in depth but provide evidence of its applicability","venue":null,"work_id":"da163c5c-302b-4292-8fa8-0921ca6ef426","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.326749Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:719ea4988f7f43b87a281e5be1f4dc318118202382dccbfaf5dda2cfa87ce995","observation_id":"554474bf-cd2d-4e37-87b8-6eb1402f756a","resolution":{"observed_at":"2026-08-06T10:19:03.243478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:02.852659Z","title":"Following [35], for super resolution, and deblurring tasks, we use the CAT-DDPM diffusion model trained on the CAT dataset [8]","venue":null,"work_id":"0a0777b8-790e-463d-9ddf-8d3cef27c4f7","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:02.457827Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:33f58dac39c8a3d3928fbf39e2b56ad37fa92fa9c3fb17c7dbcdc01fd965b62a","observation_id":"9cc8f007-c6f9-46bb-bc68-7ac05ac747c9","resolution":{"observed_at":"2026-08-06T10:19:02.964526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:06.862387Z","title":null,"venue":null,"work_id":"2d09e5d9-70a2-4f8f-88e9-543acd5e0d14","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:00.464586Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:d77dc9b7f811ac7a81252b42bf6a584f1d23183c3ffbdfa629c184227d8a0f6c","observation_id":"1fa22e79-3b2e-423f-934b-7d712ac44f24","resolution":{"observed_at":"2026-08-06T10:19:06.976010Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:19:04.806072Z","title":null,"venue":null,"work_id":"27623b79-3648-4667-9387-e7566035ad4f","year":null},"citing_paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T10:19:01.475513Z"},"links":{"citing_paper":"/paper/2508.00289"},"observation_digest":"sha256:521633745d9485781d90d480ec59b63a343de4ec7bcfb1f3f3d1e8c9c24b0d48","observation_id":"f2631690-0718-47f1-babf-55c4a7fb9daf","resolution":{"observed_at":"2026-08-06T10:19:04.970152Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00289","last_updated":"2025-08-01T03:26:18Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T02:12:56.494119Z","submitted_at":"2025-08-01T03:26:18Z","title":"TITAN-Guide: Taming Inference-Time AligNment for Guided Text-to-Video Diffusion Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":14,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2508.00289."}