{"as_of":"2026-08-20T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7dd61a54f6fea34cb94e1f38aef620dbd92a99a556ac50cf7aef00b56bcc997e","coverage":[{"denominator":101,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:38:24.857582Z","state":"measured"},{"denominator":105,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":105,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:40:31.655763Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T10:44:47.556754Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15213","snapshot_observed_at":"2026-08-07T20:40:31.655763Z","title":"Flowing from words to pixels: A framework for cross-modality evolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09775","last_updated":"2025-06-03T20:03:58Z","snapshot_observed_at":"2026-08-14T03:06:39.509714Z","submitted_at":"2025-02-13T21:10:00Z","title":"CellFlux: Simulating Cellular Morphology Changes via Flow Matching","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T20:40:31.655763Z"},"links":{"cited_paper":"/paper/2412.15213","citing_paper":"/paper/2502.09775"},"observation_digest":"sha256:52893efa4171392ee76b1f14c8da03ccbc6dbc76445acdc815d151fe581a6dd2","observation_id":"141762af-5843-40db-b580-5ceca126fcb2","resolution":{"observed_at":"2026-08-07T20:40:31.655763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"cited_work":{"arxiv_id":"2412.15213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15213","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flowing from words to pixels: A framework for cross-modality evolution","venue":null,"work_id":"00f02e12-27a0-42f5-b3dc-0be4381e5bf2","year":2024},"citing_paper":{"arxiv_id":"2603.21743","last_updated":"2026-05-20T19:52:16Z","snapshot_observed_at":"2026-08-15T01:08:04.832272Z","submitted_at":"2026-03-23T09:33:18Z","title":"CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T01:05:45.781048Z"},"links":{"cited_paper":"/paper/2412.15213","citing_paper":"/paper/2603.21743"},"observation_digest":"sha256:ea5408a4b0735cf09bb27d5ee916e0ece47eb36329858b1cfd16374460265894","observation_id":"04d0ef4c-bfd5-4a6e-9111-2a2da7e92e8e","resolution":{"observed_at":"2026-05-15T01:08:25.851113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"cited_work":{"arxiv_id":"2412.15213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15213","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flowing from words to pixels: A framework for cross-modality evolution","venue":null,"work_id":"00f02e12-27a0-42f5-b3dc-0be4381e5bf2","year":2024},"citing_paper":{"arxiv_id":"2603.21743","last_updated":"2026-05-20T19:52:16Z","snapshot_observed_at":"2026-08-15T01:08:04.832272Z","submitted_at":"2026-03-23T09:33:18Z","title":"CellFluxRL: Biologically-Constrained Virtual Cell Modeling via Reinforcement Learning","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T10:41:37.140709Z"},"links":{"cited_paper":"/paper/2412.15213","citing_paper":"/paper/2603.21743"},"observation_digest":"sha256:3120f3481b97e2282c86e26bafddf496f0fd20a2dab74e2beab9ad21f12e4003","observation_id":"340fdcd4-0ad8-409c-acbd-9929ad1ff7ee","resolution":{"observed_at":"2026-05-22T10:44:47.559518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"cited_work":{"arxiv_id":"2412.15213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15213","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flowing from words to pixels: A framework for cross-modality evolution","venue":null,"work_id":"00f02e12-27a0-42f5-b3dc-0be4381e5bf2","year":2024},"citing_paper":{"arxiv_id":"2605.02973","last_updated":"2026-05-12T16:45:17Z","snapshot_observed_at":"2026-08-11T13:21:49.316417Z","submitted_at":"2026-05-03T16:17:38Z","title":"Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-10T15:21:02.100545Z"},"links":{"cited_paper":"/paper/2412.15213","citing_paper":"/paper/2605.02973"},"observation_digest":"sha256:924a3f40224e11166c066b0715724eaef142f61bbe0269c793247c6fd5e153bd","observation_id":"37d13483-8c03-4dcb-b348-7aef11f2072f","resolution":{"observed_at":"2026-05-11T10:46:01.243621Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"cited_work":{"arxiv_id":"2412.15213","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.15213","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flowing from words to pixels: A framework for cross-modality evolution","venue":null,"work_id":"00f02e12-27a0-42f5-b3dc-0be4381e5bf2","year":2024},"citing_paper":{"arxiv_id":"2605.02973","last_updated":"2026-05-12T16:45:17Z","snapshot_observed_at":"2026-08-11T13:21:49.316417Z","submitted_at":"2026-05-03T16:17:38Z","title":"Structured Diffusion Bridges: Inductive Bias for Denoising Diffusion Bridges","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-13T07:08:43.088643Z"},"links":{"cited_paper":"/paper/2412.15213","citing_paper":"/paper/2605.02973"},"observation_digest":"sha256:9a113b43cf73ffa402ddaae2ce7087eacba88dec7956efb5962e124293d8a18f","observation_id":"ac5d18ce-5e2e-4d04-a4e3-bf6ece9f341f","resolution":{"observed_at":"2026-05-13T07:12:28.651404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.15213/citation-record","integrity":"/paper/2412.15213/integrity","json":"/paper/2412.15213/citation-record.json","paper":"/paper/2412.15213"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.334557Z","title":"Building nor- malizing flows with stochastic interpolants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.334557Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:934f01b35a1902b7a9089a45cc0b8ec0436f685984c916b3dc2c997c475acea8","observation_id":"435ba7b8-7efb-48a3-87c1-6047480ad334","resolution":{"observed_at":"2026-08-11T11:38:24.334557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08797","last_updated":"2025-10-09T00:43:44Z","snapshot_observed_at":"2026-07-06T15:03:52.079498Z","submitted_at":"2023-03-15T17:43:42Z","title":"Stochastic Interpolants: A Unifying Framework for Flows and Diffusions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08797","snapshot_observed_at":"2026-08-11T11:38:24.340460Z","title":"Stochastic interpolants: A unifying framework for flows and diffusions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.340460Z"},"links":{"cited_paper":"/paper/2303.08797","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:558ddaf2cf411b3250afabed516d364268a3a54f1daba9bd425f58e88db94059","observation_id":"696b35ef-42b4-43c9-9ddd-65a06ee14ed0","resolution":{"observed_at":"2026-08-11T11:38:24.340460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03725","last_updated":"2024-09-23T16:38:43Z","snapshot_observed_at":"2026-08-18T15:54:50.408861Z","submitted_at":"2023-10-05T17:46:31Z","title":"Stochastic interpolants with data-dependent couplings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03725","snapshot_observed_at":"2026-08-11T11:38:24.346362Z","title":"Stochastic in- terpolants with data-dependent couplings","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.346362Z"},"links":{"cited_paper":"/paper/2310.03725","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:92664e5ea375bcc93d307e6f0b3affe0f0dc011bdb9859ee75319038241ea498","observation_id":"2535447a-ffc3-4f1c-af88-af1aebdfd324","resolution":{"observed_at":"2026-08-11T11:38:24.346362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.353376Z","title":"Spice: Semantic propositional image cap- tion evaluation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.353376Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:aa3f961db7ad5b5269d55afacfb939a3d4285a884539b93df535d0cfc14cc3ff","observation_id":"5fdcfd56-3ddb-4526-b399-3d481cf01238","resolution":{"observed_at":"2026-08-11T11:38:24.353376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.359056Z","title":"Meteor: An auto- matic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.359056Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:877a3f529a4dd7df639ac6d61ebcadd9453f305d18e49a9fdf0cb825ac43df60","observation_id":"33da7a0d-bd5f-4dbd-b185-9069abac68ae","resolution":{"observed_at":"2026-08-11T11:38:24.359056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.364185Z","title":"All are worth words: A vit backbone for diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.364185Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:91711558a5d152daa216ec55acb523fc606b25bf166f5a483bed8b564a4ee0f4","observation_id":"65599890-d97c-4cce-a532-db4ef936da1e","resolution":{"observed_at":"2026-08-11T11:38:24.364185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.369364Z","title":"Adabins: Depth estimation using adaptive bins","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.369364Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:90c26d493e104a5b4902268217fee6d05a0f52c80b510565bf2c74f817019256","observation_id":"cdb82db4-c223-4e47-b5fd-8f453104466c","resolution":{"observed_at":"2026-08-11T11:38:24.369364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T11:38:24.374520Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.374520Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:8582da942296f28c45354d84996e5cdae62113eff136efd3f2267b2d3ba3fbac","observation_id":"2ed16f7a-ccda-478b-8d2c-df0c86a3e86f","resolution":{"observed_at":"2026-08-11T11:38:24.374520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.380521Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.380521Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:6000f860362000f1b284ac5e1988b5972ae82d9f6b6e53678f183946362ed67d","observation_id":"26773ebe-9b77-45d7-b855-67048c8f51d4","resolution":{"observed_at":"2026-08-11T11:38:24.380521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.10773","last_updated":"2020-01-29T12:13:20Z","snapshot_observed_at":"2026-07-06T08:53:28.193420Z","submitted_at":"2020-01-29T12:13:20Z","title":"Virtual KITTI 2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.10773","snapshot_observed_at":"2026-08-11T11:38:24.385580Z","title":"Virtual kitti 2","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.385580Z"},"links":{"cited_paper":"/paper/2001.10773","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:403105d56351cbcfbe1cd6bd307f23e4bb28e0320e4aeae4d8f5c480309831ed","observation_id":"9d1002c0-5fe6-4b7e-a249-fd6911a694ae","resolution":{"observed_at":"2026-08-11T11:38:24.385580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T11:38:24.390885Z","title":"Pixart- α : Fast training of diffu- sion transformer for photorealistic text-to-image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.390885Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:951e29d08c06405cf03800720d1d66a2bc9c6b033029d276406d9ba0af8d7ec8","observation_id":"66d9c406-3b10-48f5-acd4-d8e348de535a","resolution":{"observed_at":"2026-08-11T11:38:24.390885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.395917Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.395917Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:01ceed5383996832e941920e91b14fbbb4d39bfc90d68e78ad4c91e843c0a580","observation_id":"6f09a469-9974-4ea3-aebb-cedbe3b45c51","resolution":{"observed_at":"2026-08-11T11:38:24.395917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04202","last_updated":"2023-03-01T00:18:33Z","snapshot_observed_at":"2026-08-19T04:14:38.173722Z","submitted_at":"2022-08-08T15:08:40Z","title":"Analog Bits: Generating Discrete Data using Diffusion Models with Self-Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04202","snapshot_observed_at":"2026-08-11T11:38:24.400914Z","title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.400914Z"},"links":{"cited_paper":"/paper/2208.04202","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0e86254b819fe550226a6b7c062bc65d3e01f3578f78d3d4ade1b695c54b5a40","observation_id":"2f56a1d2-0998-4c99-9fb4-a4bf73db0424","resolution":{"observed_at":"2026-08-11T11:38:24.400914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.406134Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.406134Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0741fba10be521798cc55a8b71bd5c5af2e4336621f29a0fb31aacbf7264b5c0","observation_id":"38413d0b-8797-463c-a5e4-aba891fdc666","resolution":{"observed_at":"2026-08-11T11:38:24.406134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-16T14:57:07.361681Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-11T11:38:24.411056Z","title":"Emu: Enhanc- ing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.411056Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:78843ab595373b68ae9c3cee54350c59c01bbf3631449f71374cec45bf8d105e","observation_id":"2cac98d1-e65c-40e1-8fe4-c2d930b6f7f4","resolution":{"observed_at":"2026-08-11T11:38:24.411056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06978","last_updated":"2023-11-12T22:42:34Z","snapshot_observed_at":"2026-08-16T14:43:58.187606Z","submitted_at":"2023-11-12T22:42:34Z","title":"Augmented Bridge Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06978","snapshot_observed_at":"2026-08-11T11:38:24.415999Z","title":"Augmented bridge matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.415999Z"},"links":{"cited_paper":"/paper/2311.06978","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:24bd477d1c6e0b5055fa31f98df8769a70c4cbdd25448ed10369c61c4ee32f4b","observation_id":"c011adf8-ee11-470e-96c0-f880d242f1d5","resolution":{"observed_at":"2026-08-11T11:38:24.415999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.421143Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.421143Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:6acba12a1535532de0db60af3d4e8971a8cb4631e36eae54d067d3f3b5e2f52c","observation_id":"a20e5b31-94d9-47cd-b1b8-4037fd8be738","resolution":{"observed_at":"2026-08-11T11:38:24.421143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.426383Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.426383Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:d432dfb8bbbd0850c816bbbcf12174ae307cffb0efc4e04675bc767c625cc7e8","observation_id":"b3311588-09b5-49b9-a560-864323b2e177","resolution":{"observed_at":"2026-08-11T11:38:24.426383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05021","last_updated":"2023-08-29T05:20:36Z","snapshot_observed_at":"2026-08-16T15:49:38.385073Z","submitted_at":"2023-03-09T03:48:24Z","title":"DiffusionDepth: Diffusion Denoising Approach for Monocular Depth Estimation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05021","snapshot_observed_at":"2026-08-11T11:38:24.431295Z","title":"Diffusiondepth: Diffusion denoising approach for monocular depth estima- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.431295Z"},"links":{"cited_paper":"/paper/2303.05021","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:538e01829f3e17b770aad860ca32446c7666df4ad68ae6338c7ce395acf835d9","observation_id":"599c39d4-76e6-48be-afcd-d793974593e8","resolution":{"observed_at":"2026-08-11T11:38:24.431295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:38:24.436432Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.436432Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:295754c9aa2d150b14dd863b7ef8bcd767ffbc220aeb41d61cbcdf652678e1cf","observation_id":"51798627-2b5f-4313-bd1a-3e28b72d9095","resolution":{"observed_at":"2026-08-11T11:38:24.436432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.441443Z","title":"Omnidata: A scalable pipeline for making multi- task mid-level vision datasets from 3d scans","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.441443Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:950305233e690bdad2ae5fe1e7da949743d8e9e50b767ce02e8e3d4f2917bb57","observation_id":"664d3fb6-577b-40c5-99f8-4c93b5312a22","resolution":{"observed_at":"2026-08-11T11:38:24.441443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.446667Z","title":"Depth map prediction from a single image using a multi-scale deep network","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.446667Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:338c05b35f0b07894e73b2ddbaed5b51ae0e7803fc0394710eac57527b531570","observation_id":"93975b8c-a80f-4db1-9955-a67f1c4dd374","resolution":{"observed_at":"2026-08-11T11:38:24.446667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.451550Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.451550Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:705f623480ac9ac7c551d08d8407cd94f871aa33a676e13c3b86c2cfd7006f87","observation_id":"9222fab0-c631-4e50-8195-f03cee0d9db6","resolution":{"observed_at":"2026-08-11T11:38:24.451550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07360","last_updated":"2024-12-04T17:58:35Z","snapshot_observed_at":"2026-08-18T16:57:36.106047Z","submitted_at":"2023-12-12T15:30:24Z","title":"Boosting Latent Diffusion with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07360","snapshot_observed_at":"2026-08-11T11:38:24.456477Z","title":"Boost- ing latent diffusion with flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.456477Z"},"links":{"cited_paper":"/paper/2312.07360","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:3e26d059a7e63d8a9efe03c0a494caa6da91c2067412ab279fe8e343eb654bac","observation_id":"fec6e34e-85be-4738-a281-ca6731ddbc63","resolution":{"observed_at":"2026-08-11T11:38:24.456477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00717","last_updated":"2019-06-03T11:34:41Z","snapshot_observed_at":"2026-08-14T16:21:58.096913Z","submitted_at":"2019-06-03T11:34:41Z","title":"Masked Non-Autoregressive Image Captioning","version":1},"cited_work":{"arxiv_id":"1906.00717","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.00717","snapshot_observed_at":"2026-08-11T11:38:25.412591Z","title":"Masked Non-Autoregressive Image Captioning","venue":"cs.CV","work_id":"f216cec6-4bf9-472e-ba4d-dc96de0855b6","year":2019},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.461686Z"},"links":{"cited_paper":"/paper/1906.00717","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:7933de197b74c3579dfae23c3aac8767a78404789c26664128f575c600caf042","observation_id":"e768f982-6014-4e79-8086-eb73b7620658","resolution":{"observed_at":"2026-08-11T11:38:25.434491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.467095Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.467095Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:b986c554114304c3b44c722ac2681d9a2f74e93d7408c679f398085bf846e0d3","observation_id":"b1870aad-a429-4814-8c34-97c52515f1e5","resolution":{"observed_at":"2026-08-11T11:38:24.467095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.471843Z","title":"Geneval: An object-focused framework for evaluating text- to-image alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.471843Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:fe931ab9f5515c916ddd3ec9b4e9114a843f93cc1ca931b0ab83288e50e46a7e","observation_id":"27bda5f3-d62d-40bd-8eef-470a6ddc235c","resolution":{"observed_at":"2026-08-11T11:38:24.471843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10709","last_updated":"2024-08-02T18:55:25Z","snapshot_observed_at":"2026-08-18T16:04:08.688802Z","submitted_at":"2023-11-17T18:59:04Z","title":"Emu Video: Factorizing Text-to-Video Generation by Explicit Image Conditioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10709","snapshot_observed_at":"2026-08-11T11:38:24.477461Z","title":"Emu video: Factoriz- ing text-to-video generation by explicit image conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.477461Z"},"links":{"cited_paper":"/paper/2311.10709","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:10c44b7afa282a7e6056fd4e53c020f7cb7d4ba389bebef3b1e7264e96c2ad6f","observation_id":"d08671be-7965-4847-96e7-52a5dd099746","resolution":{"observed_at":"2026-08-11T11:38:24.477461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04690","last_updated":"2020-05-10T15:09:44Z","snapshot_observed_at":"2026-07-06T09:19:08.457938Z","submitted_at":"2020-05-10T15:09:44Z","title":"Non-Autoregressive Image Captioning with Counterfactuals-Critical Multi-Agent Learning","version":1},"cited_work":{"arxiv_id":"2005.04690","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.04690","snapshot_observed_at":"2026-08-11T11:38:25.356381Z","title":"Non-Autoregressive Image Captioning with Counterfactuals-Critical Multi-Agent Learning","venue":"cs.CL","work_id":"38685fdb-65b4-4321-bb10-39dfdb71deb6","year":2020},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.482454Z"},"links":{"cited_paper":"/paper/2005.04690","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:3eacfcd37fda59acaad7131dc37aa814a50c570710374ff7ee6175b9f14a9239","observation_id":"68188682-a165-472d-bd0f-8d05c149f92a","resolution":{"observed_at":"2026-08-11T11:38:25.363900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.487644Z","title":"Itera- tive α-(de) blending: A minimalist deterministic diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.487644Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:5c48101d4f233def307ac6519fc317118d5842847e675f98ee1947cb60f081ae","observation_id":"454665f3-e7b9-443a-9bfc-d2f3987d2a25","resolution":{"observed_at":"2026-08-11T11:38:24.487644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-11T11:38:24.492578Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.492578Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:b6c33e9c229d53c248f27ef6682eaad2ffbb4dddce98bf1db478b12b11f1928a","observation_id":"7b8aa261-e2d8-4152-ac33-1e2a5d902e26","resolution":{"observed_at":"2026-08-11T11:38:24.492578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.497935Z","title":"Gans trained by a two time-scale update rule converge to a local nash equi- librium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.497935Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:2819c5bd9b8654350c05336d6e658465582969a4a4336ec8247c05d01535c476","observation_id":"cf9ca671-cd4c-447a-8dc7-32d32354586d","resolution":{"observed_at":"2026-08-11T11:38:24.497935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T11:38:24.505068Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.505068Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:4e4a25dc6337f0e083e6bfa988f962035dae6fab34abefcf11598b287612d7ee","observation_id":"b1fe33d6-73e2-4358-a2ab-8f54d17c1886","resolution":{"observed_at":"2026-08-11T11:38:24.505068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.510215Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.510215Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:e636144625235d8f1c47c6b9e8e3d901c080d2524a3f2afaa89011a69ddebd70","observation_id":"5269352c-03d7-4eeb-aae4-6bc9a3e05b4d","resolution":{"observed_at":"2026-08-11T11:38:24.510215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T11:38:24.515325Z","title":"Ima- gen video: High definition video generation with diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.515325Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:2a245085ffde7dee62f34e3856dfda918f5c247fc68ee42c969573201e87de11","observation_id":"904461c0-79e8-48f5-9713-3a75af07872d","resolution":{"observed_at":"2026-08-11T11:38:24.515325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.521095Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.521095Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:55d529739c476e03d48f18371c6b342eb957faf9dc81556fe14171df8f414beb","observation_id":"40eacc0c-6359-46dc-9c27-bd4895ad68f8","resolution":{"observed_at":"2026-08-11T11:38:24.521095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.526093Z","title":"Estimation of non- normalized statistical models by score matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.526093Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:e61b219637dd2226ec3a970baed54499aba2e715d41768d16242471deafec9b3","observation_id":"d1b26eaf-861b-4539-bb0c-18591ad63f33","resolution":{"observed_at":"2026-08-11T11:38:24.526093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.530967Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.530967Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:12669b810bf8fa66f9450acdcc60f6e7926421705127c11f22833f8192361e09","observation_id":"35e176c5-8e95-4d2f-9e44-34eb062a2c6d","resolution":{"observed_at":"2026-08-11T11:38:24.530967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02507","last_updated":"2024-12-19T10:43:11Z","snapshot_observed_at":"2026-08-19T20:40:57.296041Z","submitted_at":"2024-06-04T17:25:59Z","title":"Guiding a Diffusion Model with a Bad Version of Itself","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02507","snapshot_observed_at":"2026-08-11T11:38:24.535892Z","title":"Guiding a dif- fusion model with a bad version of itself","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.535892Z"},"links":{"cited_paper":"/paper/2406.02507","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:da08b33662d2658f134a6e3ca720545634b0491958309eaf72e541bbe9448746","observation_id":"ffe6d42d-86ae-49b0-a74a-f4504553b7b7","resolution":{"observed_at":"2026-08-11T11:38:24.535892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:27.224529Z","title":"Re- purposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"84f694e9-c9f1-475c-987a-77d00c79e38f","year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.541093Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:409c86bbb2dfb302d77dddd3f090100ae82913a6e46eab5ef84cf306381091a8","observation_id":"d6ae7475-ca56-40cb-adba-cde0e9688f66","resolution":{"observed_at":"2026-08-11T11:38:27.231712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T11:38:24.546193Z","title":"Auto-encoding vari- ational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.546193Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:1598543ff5c524a5c756ba8f2212e5c3eb6bb2a93769b1c288798828306a10bb","observation_id":"cff8e08b-29fd-4092-9584-9c197ce3e7c8","resolution":{"observed_at":"2026-08-11T11:38:24.546193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-11T11:38:24.551473Z","title":"Diffwave: A versatile diffusion model for audio synthesis","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.551473Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:e302cbd97ff6a3458abf83e9fa974b719884c83d8ac5f2ba3f12e93f69c9fdcf","observation_id":"dcc5cccf-ed3f-4410-bad7-e5e6d6ba620c","resolution":{"observed_at":"2026-08-11T11:38:24.551473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:27.158334Z","title":"On informa- tion and sufficiency","venue":null,"work_id":"3f874f93-199a-4fde-bc98-4f77a756807a","year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.556906Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:4c55920defa7c728977410eb534aa5697ae3a91da78d868ae967a7433a4c54c0","observation_id":"77be2ad6-6aaa-4fa4-a125-39ab24c7af53","resolution":{"observed_at":"2026-08-11T11:38:27.181171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.06901","last_updated":"2018-08-27T18:00:08Z","snapshot_observed_at":"2026-08-14T19:44:20.985714Z","submitted_at":"2018-02-19T22:57:54Z","title":"Deterministic Non-Autoregressive Neural Sequence Modeling by Iterative Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.06901","snapshot_observed_at":"2026-08-11T11:38:24.561912Z","title":"De- terministic non-autoregressive neural sequence modeling by iterative refinement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.561912Z"},"links":{"cited_paper":"/paper/1802.06901","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:547b4f664d90428e6893624819236262c0160b5f19afd6899c32a8bb809ccfab","observation_id":"de3a114e-eb56-4342-9519-00280ec9bc4e","resolution":{"observed_at":"2026-08-11T11:38:24.561912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:27.044757Z","title":"Blip: Bootstrapping language-image pre-training for uni- fied vision-language understanding and generation","venue":null,"work_id":"2bce5160-596f-4f98-8c5f-8f6344a4d37e","year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.567406Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:4d55ebd6ec7e0b7750b0e1d0ef1f84c085a5c60bae3191fb1383f17df48e1f82","observation_id":"623e7f79-4038-46cf-8521-4957b81c72fd","resolution":{"observed_at":"2026-08-11T11:38:27.082916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:27.015121Z","title":"Depthformer: Exploiting long-range correlation and local information for accurate monocular depth estimation","venue":null,"work_id":"8aa2f978-ced4-4d7b-ae73-41e56437c90a","year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.572426Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:178996a99e0bba05d26f023c98d60214e493e92a1d734284256e4ceb227e9eb2","observation_id":"fc182948-8f9b-4600-b299-6c8fcdfa9152","resolution":{"observed_at":"2026-08-11T11:38:27.019954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.981677Z","title":"Binsformer: Revisiting adaptive bins for monocular depth estimation","venue":null,"work_id":"742dbb5a-891a-4103-b63f-711268145ea1","year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.577220Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:ac9a655b7f60788a2ca0c0b0476db5cb67874c52689f55039e4007c18ba1e00e","observation_id":"a454539e-bff4-4412-a474-793676f8a822","resolution":{"observed_at":"2026-08-11T11:38:27.000184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.924492Z","title":"Magic3d: High- resolution text-to-3d content creation","venue":null,"work_id":"5c9b5d68-0f30-46f6-9d98-6ce8eddb2f8a","year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.582082Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:5a38f00fe76ae6f865d94254a5aa89bb6769c3974d8111f399aac0140819945e","observation_id":"1a1aab9e-2292-4646-ad03-d4cf113c37d3","resolution":{"observed_at":"2026-08-11T11:38:26.935863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.888443Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"cfd089cd-2727-43ae-bd62-181407ca221c","year":2004},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.586806Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:f08cac7672138a973cf8df25d867c1e80f30b2be69acd6186811a54f9e2165d3","observation_id":"d341cd6d-65a3-45ae-b290-0f949296b28b","resolution":{"observed_at":"2026-08-11T11:38:26.905647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.797433Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"e4f9d01a-4548-45c1-b842-39aaab8ff0f2","year":2014},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.591896Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:f860c5e2b98381d31c29401872e979eb7fb1a7ffb8e1180e1ef9b92cbb7284a4","observation_id":"aa121f1e-86cf-49c0-9aea-2cb517f43940","resolution":{"observed_at":"2026-08-11T11:38:26.825712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.727055Z","title":"Flow matching for generative modeling","venue":null,"work_id":"2cf3d59a-5e63-4437-913e-98e9756a5080","year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.596818Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:3c1914054b9522904cfd204d0fd03972017722e6d596d51bb1d9f20d99871183","observation_id":"b2af447a-88aa-438e-b5fc-d7376ee09c64","resolution":{"observed_at":"2026-08-11T11:38:26.745891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02233","last_updated":"2024-04-18T05:25:25Z","snapshot_observed_at":"2026-08-20T18:15:16.938239Z","submitted_at":"2023-10-03T17:42:11Z","title":"Generalized Schr\\\"odinger Bridge Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02233","snapshot_observed_at":"2026-08-11T11:38:24.601431Z","title":"Gen- eralized schr \\” odinger bridge matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.601431Z"},"links":{"cited_paper":"/paper/2310.02233","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:c379336a8ead9c75b3a3aec3ac999c54d4e37f1b38e72c813150717cee0ef792","observation_id":"2923650c-0bdd-4637-8d46-3dcc0d7b7fde","resolution":{"observed_at":"2026-08-11T11:38:24.601431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05872","last_updated":"2023-05-26T02:55:08Z","snapshot_observed_at":"2026-08-16T15:55:59.111718Z","submitted_at":"2023-02-12T08:35:39Z","title":"I$^2$SB: Image-to-Image Schr\\\"odinger Bridge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05872","snapshot_observed_at":"2026-08-11T11:38:24.606458Z","title":"Image-to-image schr \\” odinger bridge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.606458Z"},"links":{"cited_paper":"/paper/2302.05872","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:7567d159f55919a0859d3d5aa6e9e52aa6e816726b3ebd0593c12f29f47e35c8","observation_id":"a0b07357-c22d-4dd5-b3a5-f0946dd25bfd","resolution":{"observed_at":"2026-08-11T11:38:24.606458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-11T11:38:24.611756Z","title":"Audioldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.611756Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:83e428668da64a87a2b3d2e61b2305b3aeff33b3ba1edad33e8853333d86377b","observation_id":"812e8610-048f-429a-abc7-6137930d26cf","resolution":{"observed_at":"2026-08-11T11:38:24.611756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.664062Z","title":"One-2-3-45: Any sin- gle image to 3d mesh in 45 seconds without per-shape opti- mization","venue":null,"work_id":"aa28dd82-2cb5-40e2-97b6-e2bf9e015a96","year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.616712Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:85347b2497d420281b308d593965bb8a1fa6fd1e6c6129dd8773705774ac8440","observation_id":"835c6f35-20e4-4488-b8d4-dba03ca0c2b1","resolution":{"observed_at":"2026-08-11T11:38:26.690883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09416","last_updated":"2024-11-28T05:35:23Z","snapshot_observed_at":"2026-08-16T13:43:13.028051Z","submitted_at":"2024-06-13T17:59:58Z","title":"Alleviating Distortion in Image Generation via Multi-Resolution Diffusion Models and Time-Dependent Layer Normalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09416","snapshot_observed_at":"2026-08-11T11:38:24.621341Z","title":"Alleviating distortion in im- age generation via multi-resolution diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.621341Z"},"links":{"cited_paper":"/paper/2406.09416","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:af754cd7b4d05cc5f0798c3d70c94dd48fe937e07b625a59d464a6a2d13cc5b2","observation_id":"321dffdd-c1d9-442f-8bfa-01fe94b20a95","resolution":{"observed_at":"2026-08-11T11:38:24.621341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.593618Z","title":"Direct-3d: Learning direct text-to-3d gen- eration on massive noisy 3d data","venue":null,"work_id":"6c3b1f3d-1046-42de-af62-f9e3378f1a19","year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.626235Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:dbb7ab6e48980bd4f32ebe758090d959b7f5e485f926f7602068bbb667394645","observation_id":"4b617335-9ec3-423d-a786-878056005954","resolution":{"observed_at":"2026-08-11T11:38:26.611347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.569904Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":"3d965bd0-fcad-4059-846c-d3669cc23e0f","year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.631203Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:d71f7eb2216dd2c981c3c0406ba83135adcea5a836891750191a9b159b07c219","observation_id":"ef6ec8cf-e611-4bc2-a642-ae739ccae802","resolution":{"observed_at":"2026-08-11T11:38:26.575060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.551221Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"b9faee9b-42ac-4bec-993f-765db1918fcc","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.635717Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:9ac2af963bfd19e95a6f61cd677d1eeb28a834aadcfecd7ca725a5fc1c096ecb","observation_id":"927889f1-d8b6-43e8-abd7-dbdc8027fac8","resolution":{"observed_at":"2026-08-11T11:38:26.557227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-11T11:38:24.640231Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.640231Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:606d1a07bc5b5bb9ed69222f78f16d76d28b04cc9563940744d21fa8b5d11d82","observation_id":"04824177-26b4-4ec3-abc1-6dc2df82fb8c","resolution":{"observed_at":"2026-08-11T11:38:24.640231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.508862Z","title":"Semantic-conditional diffu- sion networks for image captioning","venue":null,"work_id":"7536f841-438f-4d16-bc59-9156630ba933","year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.644961Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:41049d7f3db5a9a986de93878d6061e4fb8007f033f7acfc11f85c8baeb1e96b","observation_id":"315faa71-373e-4f38-97bb-2cbf0888416b","resolution":{"observed_at":"2026-08-11T11:38:26.538739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-11T11:38:24.649569Z","title":"Efficient estimation of word representations in vector space","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.649569Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:2dadc6cad4b3274c03b5e418f5111091cdb70b56ef89d30272ccb7aea13f81ac","observation_id":"0256a1f6-d609-4304-aa0b-5fa077f86c2f","resolution":{"observed_at":"2026-08-11T11:38:24.649569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-11T11:38:24.654718Z","title":"Glide: Towards photorealistic image genera- tion and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.654718Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:8b2ae0de9c28d9522a0061fca3e1c2997cb107b88400190d0f9468bbcd6319b0","observation_id":"32b8b15c-ce59-4417-b938-a10624f0947a","resolution":{"observed_at":"2026-08-11T11:38:24.654718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T11:38:24.668281Z","title":"Repre- sentation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.668281Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0ac6f7d604d1568d963adfc72ad1a331548b5dbd38585db59698a1029f3cbd98","observation_id":"89a5d589-c5f0-4b85-935d-55a4ae6af2e1","resolution":{"observed_at":"2026-08-11T11:38:24.668281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.415462Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"2ac239cb-f27f-4b3d-9e3d-a96de4cd7bd3","year":2002},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.673374Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:542e9fb3dbf1a19d9e4ce4c15a3d4d68909ddf41d3d6bd9ad269ac13d18d52ac","observation_id":"3b155c6b-0c3b-4525-8ea3-439e4e7ccc09","resolution":{"observed_at":"2026-08-11T11:38:26.446857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.323655Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"a72aa461-d163-4c1f-ae0e-ade0f93454d9","year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.678757Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:79b321dc963ab74a104241230e823355a6e45500dc2cd93e981d5aa8aa5ff9a0","observation_id":"a12bc03f-d324-4e60-8b72-a4c5dd7258a7","resolution":{"observed_at":"2026-08-11T11:38:26.365716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-11T11:38:24.683392Z","title":"Sdxl: Improving latent diffusion mod- els for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.683392Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:5ebe0edbe7897a60d254a5284a0582abd2e3c508cb0260e318bc2ed04e7f4a9f","observation_id":"54a5c6c8-a1cc-487d-b990-124b2292f91a","resolution":{"observed_at":"2026-08-11T11:38:24.683392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-11T11:38:24.688775Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.688775Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:369f79b2810c8c179058f999a1bba4b0953398aa0e4e2cd40986849224769c80","observation_id":"b18bdcb4-870a-44db-88d0-c39dc7846247","resolution":{"observed_at":"2026-08-11T11:38:24.688775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14988","last_updated":"2022-09-29T17:50:40Z","snapshot_observed_at":"2026-07-06T13:57:54.539656Z","submitted_at":"2022-09-29T17:50:40Z","title":"DreamFusion: Text-to-3D using 2D Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14988","snapshot_observed_at":"2026-08-11T11:38:24.694914Z","title":"Dreamfusion: Text-to-3d using 2d diffusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.694914Z"},"links":{"cited_paper":"/paper/2209.14988","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:fadd9574d2c4a224cd45a9aa0243e0e71472492dbdd54976898f1486a0b6769f","observation_id":"c15a7177-4620-4928-8b9d-c0cf646aa486","resolution":{"observed_at":"2026-08-11T11:38:24.694914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.287847Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"fae09ffe-a85b-4010-ba16-53ff57d81b5c","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.699829Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:285c3282b06e77366035c383a5338e69c24055149389810dda3a2109a1d9f0bc","observation_id":"ab10e947-585d-42d9-8138-b23976e2e1fd","resolution":{"observed_at":"2026-08-11T11:38:26.294938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.260508Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"e9809919-a81a-4ae5-baf9-01af065a9bfa","year":2020},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.705465Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:21bac0d8cac2d93070484c4d4ef076ddf0ade0da8b32682e9de0b7e55581a83d","observation_id":"a8d61850-790e-4699-9da7-b24908f97c9e","resolution":{"observed_at":"2026-08-11T11:38:26.272982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.710430Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.710430Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0551b09b4affe39e22791c2c604e9508b64ea220dbf88cf2e78ef6ebc93c51d2","observation_id":"6e9e38e0-f72f-47a3-87a3-a24b544c5970","resolution":{"observed_at":"2026-08-11T11:38:24.710430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-08-15T12:50:58.405488Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-11T11:38:24.715900Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.715900Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:7398620cc383ecc7db6643194db4fff1663994b85541ab8d53ec55a8d8713810","observation_id":"8533bd67-8aa2-4980-9a5a-248b28fc9ef3","resolution":{"observed_at":"2026-08-11T11:38:24.715900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.230053Z","title":"Towards robust monocu- lar depth estimation: Mixing datasets for zero-shot cross- dataset transfer","venue":null,"work_id":"1a82ba64-3765-4a35-a306-81f4e8bd5ac4","year":2020},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.721340Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:e1075cb3b873995564fef68e42b1633844a548935f1e257e09d9562e084ea287","observation_id":"df2b7584-42a1-4bfd-b062-a872340291b9","resolution":{"observed_at":"2026-08-11T11:38:26.235394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.214338Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"b39608e0-cc48-4973-b339-6179b2aa7ca1","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.726433Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:aa977ce3263a4b70594c785f0c825eb5b7c306aa0dce8c1327ba39ac5fdb1e62","observation_id":"3e51569b-60dd-4686-a8bb-b51507e0acb5","resolution":{"observed_at":"2026-08-11T11:38:26.219654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.196145Z","title":"Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding","venue":null,"work_id":"a5e75465-53d5-48b4-81c1-8dcf19a8469b","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.731625Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:be374edaf3c1eb2b26503ff0402b0949c6f47d400770593707b3035ddec211ce","observation_id":"15e99f82-e625-4053-a5eb-c6b19719311a","resolution":{"observed_at":"2026-08-11T11:38:26.202106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.176378Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"69c0ece1-a102-43db-a0d3-1e1b2a935531","year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.736881Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:c801effdb28f7dc2c8cf50664d5deb2cf84d27f65e001e1f063e30af0859bd4d","observation_id":"dbf73d05-a5b0-4baf-8693-e4e90f0bf986","resolution":{"observed_at":"2026-08-11T11:38:26.183955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.123280Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":"41aac63b-ccf3-446e-b815-c16dd91bf730","year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.741724Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:1307ed7e4ad8f1129675e7419b34f11d179a0b9a15747d1fb1adee203b6a0284","observation_id":"e23db68c-0e50-4439-b001-ff52cf29a743","resolution":{"observed_at":"2026-08-11T11:38:26.146434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.036768Z","title":"Image super-resolution via iterative refinement","venue":null,"work_id":"430db902-06aa-4360-ab0b-6263179411c4","year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.746492Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0d0b1372192182762c5de91c41b40df252eac841cd5addc0a5a233a00dda37b0","observation_id":"1d2a88ab-eec0-4525-a706-ab8f24d18c53","resolution":{"observed_at":"2026-08-11T11:38:26.087306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.017991Z","title":"A multi-view stereo benchmark with high-resolution images and multi-camera videos","venue":null,"work_id":"673ffb42-238d-479d-b55d-511d66eead36","year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.751269Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0ec7e4ee51c1ee38134372240c02f07315144fe66b22a8c40fee6184d181fe11","observation_id":"95b0e846-7ab3-4040-8233-402d1e254d80","resolution":{"observed_at":"2026-08-11T11:38:26.025917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:26.002122Z","title":"Diffusion schr¨odinger bridge matching","venue":null,"work_id":"ea258cd0-6d61-4d58-a9d6-efd365c0f06e","year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.756551Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:5c37c041dea79434242e49b5486912164461d1087f36f08228b95e1c858443d9","observation_id":"823f2e7e-25df-4f3a-885e-7bb6fd708b3f","resolution":{"observed_at":"2026-08-11T11:38:26.007530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.984350Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"f4ca893b-727c-4cf6-933a-4409a1468a4c","year":2012},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.761855Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:27ca779576e1b17480bf59cd1e55f7b12ac4bfd58409ee5b0050cd4212055411","observation_id":"5df961b1-ee8e-48c8-a3ce-55e616ec9800","resolution":{"observed_at":"2026-08-11T11:38:25.989103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T11:38:24.766536Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.766536Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0ee328451153c7cb8e27bfe037bd683606507966b1a66bda6890bfaeab062140","observation_id":"7f16c4ad-2073-4eee-a700-bd737eace2ac","resolution":{"observed_at":"2026-08-11T11:38:24.766536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.771386Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.771386Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:6fa541d388174b1785de7def6305f685949eab3504a9ba53d80f2f9b685750e4","observation_id":"3642203a-2cbb-4b89-b89e-f7b3725a8ba3","resolution":{"observed_at":"2026-08-11T11:38:24.771386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.953250Z","title":"Generative modeling by estimating gradients of the data distribution","venue":null,"work_id":"d9472b77-ff14-4acb-b83e-48864726e93a","year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.776146Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:e7ef3233a2dc9fc8bfda73d1aa54bd8a60d34e774dc9904aeafb338d600617ab","observation_id":"88e18801-2dd1-4499-8043-8e27ff2bc0a5","resolution":{"observed_at":"2026-08-11T11:38:25.958130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.935361Z","title":"Score- based generative modeling through stochastic differential equations","venue":null,"work_id":"a00734cf-ac09-4e24-aa94-e0c6418d6d09","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.781086Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:08d070c3cdc43169a50eea1c502850ad01709b16466dc582aec6351cb36f337d","observation_id":"fb1436ba-f435-44a6-9a86-b88626b238c8","resolution":{"observed_at":"2026-08-11T11:38:25.940540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14623","last_updated":"2024-10-29T02:54:10Z","snapshot_observed_at":"2026-08-17T04:13:42.221015Z","submitted_at":"2024-03-21T17:59:41Z","title":"Simplified Diffusion Schr\\\"odinger Bridge","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14623","snapshot_observed_at":"2026-08-11T11:38:24.786272Z","title":"Simplified diffusion schr \\” odinger bridge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.786272Z"},"links":{"cited_paper":"/paper/2403.14623","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:5e9ca8951530f5cb8eb3cfcbe431c84c394f3f328151fc6e01a4dd3f38cb3082","observation_id":"419b73e6-a504-42c6-b44d-b237061b9551","resolution":{"observed_at":"2026-08-11T11:38:24.786272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03672","last_updated":"2024-03-11T14:42:58Z","snapshot_observed_at":"2026-08-19T04:48:14.129797Z","submitted_at":"2023-07-07T15:42:35Z","title":"Simulation-free Schr\\\"odinger bridges via score and flow matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03672","snapshot_observed_at":"2026-08-11T11:38:24.791769Z","title":"Simulation-free schr \\” odinger bridges via score and flow matching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.791769Z"},"links":{"cited_paper":"/paper/2307.03672","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:698b9a9e59ccef7bdf13740595a2c5c8403b121baad6048bbc7ec61f26266ab5","observation_id":"ea3ea140-c91c-44a3-8512-863096c0be7d","resolution":{"observed_at":"2026-08-11T11:38:24.791769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.00463","last_updated":"2019-08-29T04:17:49Z","snapshot_observed_at":"2026-08-15T10:05:41.585216Z","submitted_at":"2019-08-01T15:39:54Z","title":"DIODE: A Dense Indoor and Outdoor DEpth Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.00463","snapshot_observed_at":"2026-08-11T11:38:24.797704Z","title":"Diode: A dense indoor and outdoor depth dataset","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.797704Z"},"links":{"cited_paper":"/paper/1908.00463","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:96e1d68f5d8d42d5bf7ca004d5a359bf4cf8dbe7778deb08984505089107f6b0","observation_id":"2e03979d-5c27-4186-ad13-194b758e158b","resolution":{"observed_at":"2026-08-11T11:38:24.797704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.919204Z","title":"Attention is all you need","venue":null,"work_id":"74221434-9214-44aa-a5fa-9fba10f3ee3e","year":2017},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.803597Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:df483ce1bdd6ec1929233aa0e1c6f064bb54805921c4cf8f9445153fce5b79a5","observation_id":"8cb2929d-3c2c-4642-8d6b-047cb1a5a115","resolution":{"observed_at":"2026-08-11T11:38:25.924116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.902396Z","title":"Cider: Consensus-based image description evalu- ation","venue":null,"work_id":"a84f4182-6f94-48a8-9f4e-8a5aff863904","year":2015},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.808441Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:1337bd048f42f6e16d6d669e6f70fbb5b17ba1495a79d84424fcc898f81d3b88","observation_id":"69ea2cca-8813-47bb-85af-d9f925f62c10","resolution":{"observed_at":"2026-08-11T11:38:25.907788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.823221Z","title":"Raphael: Text-to- image generation via large mixture of diffusion paths","venue":null,"work_id":"4224813f-f81b-4b71-a75b-bdf48557ffc3","year":2024},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.813786Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:e0b63955f0f0fad1a8af585760acb78201f0c12548dee5b1d4e58abcfe0b82e8","observation_id":"279b5a4c-03d9-4926-9f7b-cb9cbc8241e3","resolution":{"observed_at":"2026-08-11T11:38:25.859071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.798853Z","title":"Transformer-based attention networks for con- tinuous pixel-wise prediction","venue":null,"work_id":"215f777b-987d-4566-8a40-a4002fd172c7","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.819080Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:5c880dad8b003f6ab41287bb28b5cf0b1fa30c7f3eca3e2756517c0026bcf2bb","observation_id":"dc822a03-7289-4a90-97c0-9321bcaba714","resolution":{"observed_at":"2026-08-11T11:38:25.805563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:24.824360Z","title":"Depth anything: Un- leashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.824360Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:0b3af49af25633205517c8601b999783169fd4d992fe4d973c8095780810675f","observation_id":"1fa78ac5-c240-4d55-bd14-dfafa557a640","resolution":{"observed_at":"2026-08-11T11:38:24.824360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.00569","last_updated":"2020-03-28T08:26:57Z","snapshot_observed_at":"2026-08-20T04:50:08.671987Z","submitted_at":"2020-02-03T05:38:33Z","title":"DiverseDepth: Affine-invariant Depth Prediction Using Diverse Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.00569","snapshot_observed_at":"2026-08-11T11:38:24.829998Z","title":"Di- versedepth: Affine-invariant depth prediction using diverse data","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.829998Z"},"links":{"cited_paper":"/paper/2002.00569","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:9043e2429fb92c49e9f665a6d1827ec934326f23f3a612dcdd78f22dadf37a5d","observation_id":"e34d1de4-3209-4315-b037-4ab941705781","resolution":{"observed_at":"2026-08-11T11:38:24.829998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.759231Z","title":"Learning to re- cover 3d scene shape from a single image","venue":null,"work_id":"b3ae4e49-57ab-4097-8079-6967a056caef","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.835494Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:e2fe101b5519d115f011ee1dbe19a3acb2c73977590e445d7bff63d0455816d9","observation_id":"abf79ddf-1464-4d4e-8691-5e96135421a3","resolution":{"observed_at":"2026-08-11T11:38:25.767038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.735120Z","title":"Image captioning with semantic attention","venue":null,"work_id":"0c79f1a1-d161-49eb-a700-da43c475efc7","year":2016},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.841065Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:2467387afa5083a4d1b3d9a2857036e125cfba49bc05ef8b32c9260980dcd719","observation_id":"f30f524f-6022-4d28-aa4c-961f161a5ba9","resolution":{"observed_at":"2026-08-11T11:38:25.742308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.713327Z","title":"Hierarchical normalization for robust monocular depth estimation","venue":null,"work_id":"d4c6fa85-f6b8-4333-abf8-e0a8c67742e7","year":2022},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.846646Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:5a0814f08ab2c61ab4045a41847d82481e3439d372541c6726d76f6039d14c92","observation_id":"2bc72218-1650-473b-b085-efa2c254e99f","resolution":{"observed_at":"2026-08-11T11:38:25.720329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16948","last_updated":"2023-12-05T08:01:39Z","snapshot_observed_at":"2026-08-16T23:35:08.886564Z","submitted_at":"2023-09-29T03:24:24Z","title":"Denoising Diffusion Bridge Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16948","snapshot_observed_at":"2026-08-11T11:38:24.852458Z","title":"Denoising diffusion bridge models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.852458Z"},"links":{"cited_paper":"/paper/2309.16948","citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:ea0c1c00ef2cf1879f223baa0420cfd7190ae9d09e78421dc087b9c74e9b3acd","observation_id":"a7b66d6a-538b-4d94-9439-af4ff69d4080","resolution":{"observed_at":"2026-08-11T11:38:24.852458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:38:25.686195Z","title":"Semi-autoregressive transformer for image captioning","venue":null,"work_id":"51b2735f-cb40-4ad3-ad6b-85ef984749ae","year":2021},"citing_paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-11T11:38:24.857582Z"},"links":{"citing_paper":"/paper/2412.15213"},"observation_digest":"sha256:877dfac11bb0afd82eeff625ca6ca1e917e7c4103397ee317f0800521282aade","observation_id":"4623e797-82c7-4cda-83b5-126e6adc3829","resolution":{"observed_at":"2026-08-11T11:38:25.696150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.15213","last_updated":"2025-03-24T04:06:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T20:32:59.562582Z","submitted_at":"2024-12-19T18:59:56Z","title":"Flowing from Words to Pixels: A Noise-Free Framework for Cross-Modality Evolution"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":101},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 101 outbound references and 5 inbound Pith citation observations for arXiv:2412.15213."}