{"as_of":"2026-08-15T19:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9bbb78efa2edc4cad231124763c58ffd2a52cf87f079272617a43c4e9d296493","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:41:58.965498Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:59:35.563998Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T05:51:25.529624Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-07T14:59:35.563998Z","title":"Omniflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16839","last_updated":"2026-07-15T22:41:27Z","snapshot_observed_at":"2026-08-14T13:42:27.582012Z","submitted_at":"2025-05-22T16:07:12Z","title":"LaViDa: A Large Diffusion Language Model for Multimodal Understanding","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:59:35.563998Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2505.16839"},"observation_digest":"sha256:438d6f2a243d981f82428dd3bb8361c331d1a48ad9bc33d3661475703f55e122","observation_id":"52608195-9992-48b1-ab74-4c2502fe686c","resolution":{"observed_at":"2026-08-07T14:59:35.563998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-07T12:53:23.481480Z","title":"Omniflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-15T07:17:17.379167Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.481480Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:32de2d3d717f2b541e9cbcac5a9b8d9c67e8c6aff4735b8d3d337d3baaf5f5af","observation_id":"43be3b75-d5fa-411d-a840-991ebc006b4b","resolution":{"observed_at":"2026-08-07T12:53:23.481480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-07T05:34:51.345354Z","title":"Omniflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07903","last_updated":"2025-06-12T23:40:11Z","snapshot_observed_at":"2026-08-15T18:08:09.441473Z","submitted_at":"2025-06-09T16:20:20Z","title":"Diffuse Everything: Multimodal Diffusion Models on Arbitrary State Spaces","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:34:51.345354Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2506.07903"},"observation_digest":"sha256:f83f39e1b946b0c5ed18deea3ca448af5aca056b2821af5c9313e9cb14dd4a0b","observation_id":"08756ba8-eb7c-4020-943c-5cc4f05a57f7","resolution":{"observed_at":"2026-08-07T05:34:51.345354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-07T05:11:23.676792Z","title":"Omniflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08796","last_updated":"2025-06-10T13:44:49Z","snapshot_observed_at":"2026-08-13T09:06:10.083133Z","submitted_at":"2025-06-10T13:44:49Z","title":"Flow Diverse and Efficient: Learning Momentum Flow Matching via Stochastic Velocity Field Sampling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:11:23.676792Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2506.08796"},"observation_digest":"sha256:73946245d056b745caa2d50c958631b2ec22c5486176fa3278777cb99fa69180","observation_id":"9ebe2114-334c-42b0-ac95-61f35730573a","resolution":{"observed_at":"2026-08-07T05:11:23.676792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-04T18:00:37.408957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10384","last_updated":"2025-09-12T16:18:16Z","snapshot_observed_at":"2026-08-13T12:57:51.443540Z","submitted_at":"2025-09-12T16:18:16Z","title":"Flow Straight and Fast in Hilbert Space: Functional Rectified Flow","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T18:00:37.408957Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2509.10384"},"observation_digest":"sha256:bdb3085922fc8a4de1b9adea5d6a0f34aa3e632d18bfcc184e41c2404d805b12","observation_id":"e5cec857-e94b-4962-9b6d-4236679b470c","resolution":{"observed_at":"2026-08-04T18:00:37.408957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-08-04T15:39:37.010618Z","title":"Omniflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.19244","last_updated":"2026-07-15T22:48:21Z","snapshot_observed_at":"2026-08-13T18:55:13.828466Z","submitted_at":"2025-09-23T17:05:46Z","title":"Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T15:39:37.010618Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2509.19244"},"observation_digest":"sha256:159c6c3634c84aad88cc4d01d1c8c7ce5651dc75f121cdde022d47fabe457650","observation_id":"4ced0174-0da9-4e56-bd04-66c6fd7506c5","resolution":{"observed_at":"2026-08-04T15:39:37.010618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"cited_work":{"arxiv_id":"2412.01169","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01169","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Om- niflow: Any-to-any generation with multi-modal rectified flows","venue":null,"work_id":"f085e564-118a-409f-851f-13855757395e","year":2024},"citing_paper":{"arxiv_id":"2605.09622","last_updated":"2026-05-10T16:08:36Z","snapshot_observed_at":"2026-08-10T22:15:49.531795Z","submitted_at":"2026-05-10T16:08:36Z","title":"Any2Any 3D Diffusion Models with Knowledge Transfer: A Radiotherapy Planning Study","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:53:06.362430Z"},"links":{"cited_paper":"/paper/2412.01169","citing_paper":"/paper/2605.09622"},"observation_digest":"sha256:eebc46b5c08efaa8d90da7a951fe085b4631d6f1a741919ede28e2b8bc8c4fff","observation_id":"2bcaa1ba-a0f9-462b-8831-b78185c9ddb6","resolution":{"observed_at":"2026-05-12T05:51:25.532529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01169/citation-record","integrity":"/paper/2412.01169/integrity","json":"/paper/2412.01169/citation-record.json","paper":"/paper/2412.01169"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T04:41:58.695892Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.695892Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:29ccd4e9800a88bc92838ae670c497fa9528e2f13f6fcb1306c2c541e3ed0078","observation_id":"80172247-fb91-44be-a825-d9e64dc83ff6","resolution":{"observed_at":"2026-08-12T04:41:58.695892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.864099Z","title":"Soundnet: Learning sound representations from unlabeled video","venue":null,"work_id":"2b0b512d-4440-4df1-b8a2-ea9cbf168185","year":2016},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.701251Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:aa0a033e0b1c53263f09be3bbcd125e77902d37547b9f365424ec3e5c1200863","observation_id":"1ff5d55a-d177-4a51-b74d-a7f14a6feaba","resolution":{"observed_at":"2026-08-12T04:41:59.869427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.848163Z","title":"Audiosetcaps: Enriched audio captioning dataset generation using large audio language models","venue":null,"work_id":"706d3263-d381-43e0-b4e3-769644337e15","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.706294Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:b54fe53e7958f67b8e9f24caf77d2b33e8e9d0faeeefbc264f21770791983937","observation_id":"b7df825a-f920-4572-ba07-5776ae5e7062","resolution":{"observed_at":"2026-08-12T04:41:59.852892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.833225Z","title":"One transformer fits all distributions in multi-modal diffusion at scale","venue":null,"work_id":"07e6e207-8de7-47ab-8061-d3b65ba9a88e","year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.710899Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:3f1d31c624c5850d3305ef953d498ef86f72ca250fa856b8210584176bb7ab54","observation_id":"8f9c18c3-0993-478b-8dfc-def875b09431","resolution":{"observed_at":"2026-08-12T04:41:59.838101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.818943Z","title":"Coyo-700m: Image-text pair dataset","venue":null,"work_id":"e18a0ce0-fc7b-49e7-be16-9ed05677fe6f","year":2022},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.715454Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:6b39da6d8b6d2a81a18948b1195fbb81554c42890e9602bdbfe6b535c99a9b3a","observation_id":"d3f5ccb4-c2b6-4989-bf17-da0a20f88049","resolution":{"observed_at":"2026-08-12T04:41:59.823540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.804645Z","title":"Conceptual 12M: Pushing web-scale image-text pre- training to recognize long-tail visual concepts","venue":null,"work_id":"793fdc2f-d359-440d-b80d-64be397e64c3","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.720109Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:324be66086c332bf8a6602afcc1dc434dfe227e47c08057c6657bf188b05f738","observation_id":"d7b5ff61-7cc2-4689-a578-0fe393d9e436","resolution":{"observed_at":"2026-08-12T04:41:59.809348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.789773Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"99cc2c65-c391-4052-9aba-9bb082e0a92c","year":2020},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.724969Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:f5ddbc37f7a93145b518882996ce00d9c4ccfac079739039452cfed9406192ee","observation_id":"e26b7d62-9c3c-4cbb-a0ce-e9f6e42f795f","resolution":{"observed_at":"2026-08-12T04:41:59.794621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09503","last_updated":"2024-10-12T11:43:54Z","snapshot_observed_at":"2026-08-14T05:29:47.864528Z","submitted_at":"2024-10-12T11:43:54Z","title":"SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs","version":1},"cited_work":{"arxiv_id":"2410.09503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.09503","snapshot_observed_at":"2026-08-12T04:41:59.227053Z","title":"SLAM-AAC: Enhancing Audio Captioning with Paraphrasing Augmentation and CLAP-Refine through LLMs","venue":"eess.AS","work_id":"1103b2bd-5de0-4899-b10c-1840503c4937","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.729766Z"},"links":{"cited_paper":"/paper/2410.09503","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:e652302a4449d67db675030822df9db0f7769cfd7cc366a385f0df9d0813ec98","observation_id":"de1471bd-58dc-41b1-a440-e190558e99dd","resolution":{"observed_at":"2026-08-12T04:41:59.233860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.774432Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":"6e5c6bff-553f-447d-8973-12d80a014d42","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.734983Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:506dc195337e014ca2a8bb6799d6b4b7cdb36c4a4f8f9ed617325f8093093f5e","observation_id":"2807c2a2-f8ae-432e-87b1-d68cd01983e2","resolution":{"observed_at":"2026-08-12T04:41:59.779644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.757962Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"7530cf9c-7e5b-4f1f-ab9b-40d1be32a31e","year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.739098Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:257a75d58015facfabade50f7c48f6327dedbeefbc147d3baaf054aa2e132969","observation_id":"8b481c2c-1a4a-4843-b2be-526c7a2da070","resolution":{"observed_at":"2026-08-12T04:41:59.763042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.742700Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis","venue":null,"work_id":"4961fe11-8c83-4c48-910b-b8c583d96434","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.743809Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:ef509e8e0a8a7599e08a389e3743c3742591c0cb1ce4c1d589aede408826459b","observation_id":"b79bd482-a7fe-456b-aeed-3a34b3f078b6","resolution":{"observed_at":"2026-08-12T04:41:59.747315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.727600Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"17b29db3-32c9-4612-a612-c4b6905a6e99","year":2017},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.748161Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:433ce56b594ed5cc646b83d54b459dc7bcda638b8a54bd9b266874dbb38b91f5","observation_id":"f700cbe1-38e2-4afa-a9de-ad53700f03f5","resolution":{"observed_at":"2026-08-12T04:41:59.732688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.712046Z","title":"Geneval: An object-focused framework for evaluating text-to- image alignment","venue":null,"work_id":"bc66c290-5ae0-4805-8b55-604210578e4b","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.752616Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:5628fba7794619e8bc4810e313e3a16821ade2f010334516452c2c2d724f7620","observation_id":"2bf2599f-7c1c-4ea2-bc74-109c2f134fc4","resolution":{"observed_at":"2026-08-12T04:41:59.717237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.697660Z","title":"Text-to-image-2m dataset, 2024","venue":null,"work_id":"54a022b5-3089-434b-9b0a-3cfd4bd5afce","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.756828Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:d5aa68e7dcf565564db1d657d99ce8c57d05c0db7ea0c1acb70c0ccd40a6627b","observation_id":"334aee7e-57ab-48c5-aeb0-47d334d87071","resolution":{"observed_at":"2026-08-12T04:41:59.702327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:58.761532Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.761532Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:951774990a587af31770eae8e2d736570f7f272f7b5fa4d1fd2978559ebcba08","observation_id":"320147df-2394-42f3-8bc6-94bde91ee8ad","resolution":{"observed_at":"2026-08-12T04:41:58.761532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-12T04:41:58.765962Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.765962Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:ac88244741e9b6854fcee4725a8fe5d56d0e75482524b64975229ed11e7a0bb4","observation_id":"0c0fc8d5-a86a-4b4b-8f5a-16973d13a3e7","resolution":{"observed_at":"2026-08-12T04:41:58.765962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-12T04:41:58.770710Z","title":"Imagen video: High definition video generation with diffusion models.arXiv preprint arXiv:2210.02303, 2022","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.770710Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:4f200b0f040d6264ba0981337dd3550d0785b26c3b867310092d02a3466ce86d","observation_id":"c5f08eda-37a5-43bc-9631-bfcc9ae493da","resolution":{"observed_at":"2026-08-12T04:41:58.770710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-13T11:30:24.178620Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-12T04:41:58.775653Z","title":"Make-an-audio 2: Temporal-enhanced text-to- audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.775653Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:b847054baba509903f07df5ac01a9bc06f07d4101d2ca152cc39656696c880d8","observation_id":"b93a4ac1-4156-4ca1-b18e-ea5e3eff11dc","resolution":{"observed_at":"2026-08-12T04:41:58.775653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.673271Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":"65b85323-61a5-44ba-93e0-7a75569cd116","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.780711Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:e2c1a604f3fdb6c1b1d5a5e801c649cc9fcf1d50202d879397f55c221dbe0919","observation_id":"6bb9dc43-5aab-4b3e-924c-1c174ac6f688","resolution":{"observed_at":"2026-08-12T04:41:59.677967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.08466","last_updated":"2019-01-17T16:12:43Z","snapshot_observed_at":"2026-08-15T08:25:11.276003Z","submitted_at":"2018-12-20T10:28:00Z","title":"Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.08466","snapshot_observed_at":"2026-08-12T04:41:58.785132Z","title":"Fr \\’echet audio distance: A metric for evaluating music enhancement algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.785132Z"},"links":{"cited_paper":"/paper/1812.08466","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:252abffca022410d44413dddd0c2e5c849d2b79a7544ef0546853fbda493194b","observation_id":"007b8214-6836-49b2-841d-1a3950d4afbd","resolution":{"observed_at":"2026-08-12T04:41:58.785132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.657902Z","title":"Audiocaps: Generating captions for audios in the wild","venue":null,"work_id":"614bf934-f638-4bd4-9e0f-653f38f1f9a8","year":2019},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.789874Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:dae80f245c20a6fa13734485836a5f024d370c49939d64275d2490ccbdf09379","observation_id":"a98b045d-7610-48c3-81e9-b5ca875f93a8","resolution":{"observed_at":"2026-08-12T04:41:59.662875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.642187Z","title":"Understanding diffusion ob- jectives as the elbo with simple data augmentation","venue":null,"work_id":"ab06c736-a2f9-4013-b1c2-846728ce8069","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.794240Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:3d7def0bc13028d680f340d0c6d2def0773c2c9bdb116b08a42fb4a75502ff86","observation_id":"f0204d47-2aff-49a4-ac9a-2ec73b286ddc","resolution":{"observed_at":"2026-08-12T04:41:59.647193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.625425Z","title":"Equivariant flow matching","venue":null,"work_id":"53b7df38-0c6a-48e9-b1ab-abea5e38892c","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.798876Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:25f4ad7903005ad489c293f3322b5d6de5d014e825bd9c99629fe32a1aa83e12","observation_id":"248e4d2d-532a-4b7e-9089-9afa20e068cf","resolution":{"observed_at":"2026-08-12T04:41:59.630418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-15T19:10:15.781183Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-12T04:41:58.803381Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.803381Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:8adaddbb37ffb9478a606e5fe4cd3ddb9002e3ad35728f6a5fedf147b7ce3cdc","observation_id":"04286985-c320-4d5c-b573-024e5a7f7941","resolution":{"observed_at":"2026-08-12T04:41:58.803381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.610305Z","title":"Aesthetics for open source, 2023","venue":null,"work_id":"731603b2-9a94-4b2f-a48c-83089fe91898","year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.807905Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:a8a4569c91a311829d588cbfc462218e9c644d05b581a58c5db97582abf8c02d","observation_id":"29552902-3cb3-4d10-8f0d-7de3493cd21c","resolution":{"observed_at":"2026-08-12T04:41:59.615043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.595447Z","title":"Laion coco: 600m synthetic captions from laion2b- en, 2023","venue":null,"work_id":"6ad6b8a2-fff4-4fd6-ba20-6c6a0f8fe1ef","year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.812102Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:6463e4bc47288a1200341676d6eb1fedf22ada11c9a5f6baff8f6303dba1c6b6","observation_id":"7f48e964-7d82-4ece-a0e3-d45e75b654ae","resolution":{"observed_at":"2026-08-12T04:41:59.600347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04092","last_updated":"2020-10-11T23:33:10Z","snapshot_observed_at":"2026-08-04T18:37:50.618230Z","submitted_at":"2020-04-05T06:20:18Z","title":"Optimus: Organizing Sentences via Pre-trained Modeling of a Latent Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04092","snapshot_observed_at":"2026-08-12T04:41:58.816407Z","title":"Optimus: Organizing sentences via pre-trained modeling of a latent space","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.816407Z"},"links":{"cited_paper":"/paper/2004.04092","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:a4ac619bc2562b9e7690efa5e2805c8c95b63ef8ec8f81bd1065da75323a9958","observation_id":"2687f756-f306-4d73-94af-7032742ed0eb","resolution":{"observed_at":"2026-08-12T04:41:58.816407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:58.820882Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.820882Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:81f74a72ee8ec75aac8a3178356b1595b82101805381cd8b7f2789906b2c8e50","observation_id":"b96a9428-f234-4389-a5d8-93b66b7c0b1e","resolution":{"observed_at":"2026-08-12T04:41:58.820882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:58.825565Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.825565Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:0d6536607ae0502d04c8a1de869fdff7a902a3fc81df30ddf06c9aabb052e33e","observation_id":"88af7c7b-04fe-4c40-b94e-b7f9cab21d57","resolution":{"observed_at":"2026-08-12T04:41:58.825565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:58.830424Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.830424Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:6661a32146b89b447550c33a0ea26aa3e2002d8a3fd1b9c178ab491cd859d2d1","observation_id":"4b3732aa-6928-41e8-a767-e8845c5c7947","resolution":{"observed_at":"2026-08-12T04:41:58.830424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-12T04:41:58.834733Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.834733Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:5e4d8151109edf8ac2a556b5b93ee9b5037064861404450fabe087a552a169b8","observation_id":"d3ac34e2-b2c3-400e-8a9b-cc29a54fdd43","resolution":{"observed_at":"2026-08-12T04:41:58.834733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-13T12:55:40.566213Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-12T04:41:58.839020Z","title":"Audi- oldm: Text-to-audio generation with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.839020Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:ed3340d8e7e6390b1a1240c8da26c4e55b3d8040b61b76667a19a2c0b23910cd","observation_id":"c630f42a-ffe3-4939-9baf-4c49d857662a","resolution":{"observed_at":"2026-08-12T04:41:58.839020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.550931Z","title":"Audioldm 2: Learning holistic audio gen- eration with self-supervised pretraining","venue":null,"work_id":"fa21c653-b8a1-4f58-b994-fa55197d19a7","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.843452Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:d36cb5948e3629adba0e7a40d45363b04a0b0bafe12d59842a26c0908d0142af","observation_id":"7d3eb5f8-5726-4468-9ec8-b59e54959409","resolution":{"observed_at":"2026-08-12T04:41:59.555396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-12T04:41:58.847351Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.847351Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:97abc96c762f3dee0df68dd59c51d731a4823d12d3f459f1d0483fb1da45f445","observation_id":"3cd2133d-490a-425a-8dac-84f5b8158761","resolution":{"observed_at":"2026-08-12T04:41:58.847351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.536941Z","title":"Discrete diffusion modeling by estimating the ratios of the data distri- bution","venue":null,"work_id":"f1f73ec0-21b1-499b-9426-9e001525fdb4","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.851977Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:e9f583d8d3fc464cdf8b2fee9ee619102885c1af11267aa2171963905cacf3c1","observation_id":"59960bc1-3f46-448b-9ed2-7bb3ee4e58a9","resolution":{"observed_at":"2026-08-12T04:41:59.541623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.522681Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"4835c77a-e2a2-4696-9187-33e6b8968e10","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.856067Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:86a78005c63edd2b3a5c2c3eacee1585482e4608ae86a1d0d7ffd198dbf6b164","observation_id":"92dd91c5-768a-4d92-ad19-03d8a2a8f659","resolution":{"observed_at":"2026-08-12T04:41:59.527405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.506721Z","title":"Wavcaps: A chatgpt-assisted weakly-labelled audio captioning dataset for audio-language multimodal re- search","venue":null,"work_id":"9014809a-598b-4df2-9604-f0950062d463","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.860248Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:d49dcc1b76f33672c3390812d4b348bceec56d6ed56ea6ffd42f70075fd56c77","observation_id":"941ddad8-4831-4a07-bcd3-a71eff0aa9f2","resolution":{"observed_at":"2026-08-12T04:41:59.511707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.491534Z","title":"Image generated using midjourney ai, 2024","venue":null,"work_id":"43506c5c-1fd6-44ee-8625-053df65bdbfb","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.864869Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:1dfd45834fde302450b3bf527797aaf7457afcb2af4a45900f8b3500c9b93abf","observation_id":"f11ce163-9154-4ef4-8e5a-316b398398cf","resolution":{"observed_at":"2026-08-12T04:41:59.496602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:58.869147Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.869147Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:de566e2f2d6485b8cb186a3d041ff7c5362c6b024f86711a556eb946e9e3b336","observation_id":"40ef35a9-3d82-445f-b56b-c92d13e71590","resolution":{"observed_at":"2026-08-12T04:41:58.869147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.467777Z","title":"Dall-e 3, 2023","venue":null,"work_id":"386ad282-6853-40c1-95e7-a8e618e1ed18","year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.873640Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:7e580155a1d80081a277bc7323ce11dca40ca4accc6dab9f91c4835aa93a1af9","observation_id":"11c577e3-2467-4e9f-a9e8-90ceeaa0b75b","resolution":{"observed_at":"2026-08-12T04:41:59.472582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:58.877953Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.877953Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:cb8c3b97800092a90a71bee36cf7706f1f1165786d91dbbcb3d29df37e875ed9","observation_id":"a63e716a-71d1-4e97-b0ea-c41f5ba8925f","resolution":{"observed_at":"2026-08-12T04:41:58.877953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-12T04:41:58.882504Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.882504Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:29945eddc09d6e92647f6a1658015490cbd0beeaa02022b01e0bf0670ff3658e","observation_id":"cfd6255d-caec-473c-bb36-78b765dacad4","resolution":{"observed_at":"2026-08-12T04:41:58.882504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:58.887454Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.887454Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:ff1f33640bf6b7d5ccb0a1c87237d589dac100069e0eaa20e0318dbd458908b4","observation_id":"aec40632-a6ea-4845-b3bf-8712a40323e6","resolution":{"observed_at":"2026-08-12T04:41:58.887454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.432201Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"cc3869f5-7eb3-4613-a98e-26216fb3c588","year":2022},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.892118Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:72bcdb99f75a6ae1fab178564a6ea9dd8162474c049635b4ab19252d76201aed","observation_id":"4bed7f85-98df-4e04-b16c-6d7fdda8e690","resolution":{"observed_at":"2026-08-12T04:41:59.437189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.417547Z","title":"Simple and effective masked diffusion language models","venue":null,"work_id":"20465503-ac53-4c78-bdb0-e24586c9b76f","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.896482Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:176554dffb0625aeeefbdf118b9fc4d1ecb87b87fa08e1f76786a88167f8f433","observation_id":"92c621be-e835-4bdf-b4c0-88af9e8c2088","resolution":{"observed_at":"2026-08-12T04:41:59.422384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.403091Z","title":"Any-to-any generation via composable diffu- sion","venue":null,"work_id":"85b3ef19-9df6-4caa-9b72-78e8b5511f4f","year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.901017Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:4890b67a82d08aa87b66629234cd161ae26ce0c862033e6c585293e0bc7902d3","observation_id":"cf004235-c4a9-4120-8a87-d3f24a81a579","resolution":{"observed_at":"2026-08-12T04:41:59.407711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T04:41:58.905354Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.905354Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:6501db4675032112d7c01591bc007bb50244d8a26ee87cb2b34a1815dce62cf6","observation_id":"80a4ec9c-b2c6-471a-8788-f41b94149161","resolution":{"observed_at":"2026-08-12T04:41:58.905354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-12T04:41:58.910066Z","title":"Conditional flow matching: Simulation-free dynamic optimal transport","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.910066Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:bd5f45c5a0da7f8920bdf366a890752a69759914c412496ff3f1019ecf2e9fba","observation_id":"f9f188a4-f49a-4e7a-9162-f0e03a9fa852","resolution":{"observed_at":"2026-08-12T04:41:58.910066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.388199Z","title":"Cider: Consensus-based image description evalu- ation","venue":null,"work_id":"939eda86-0f8f-4647-949b-2094a8f57e52","year":2015},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.914495Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:efc6f33958b792857fe77e08fd7d157d95d6fa6451252c6d4b2054fe6a320428","observation_id":"86d9bee7-03d3-4c2d-a90d-114cddad3b8a","resolution":{"observed_at":"2026-08-12T04:41:59.393341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04627","last_updated":"2022-06-05T01:57:58Z","snapshot_observed_at":"2026-08-13T12:11:58.325060Z","submitted_at":"2021-10-09T18:36:00Z","title":"Vector-quantized Image Modeling with Improved VQGAN","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04627","snapshot_observed_at":"2026-08-12T04:41:58.918819Z","title":"Vector-quantized image modeling with improved vqgan","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.918819Z"},"links":{"cited_paper":"/paper/2110.04627","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:4697b8066f4e715ffbbd8edf4d3e4402d66dcf9591511da1746de9dcd179bdf5","observation_id":"1ac6539f-4d1f-40a5-bd7a-5ea408400e3a","resolution":{"observed_at":"2026-08-12T04:41:58.918819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-12T04:41:58.923969Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.923969Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:fe117541cd5ae01f3ce9247d786d5f7b49fab61b167acb8bb022e2b4cd4eec99","observation_id":"0b5426c5-4765-4e1b-b98a-be32add155b4","resolution":{"observed_at":"2026-08-12T04:41:58.923969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-12T04:41:58.928534Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.928534Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:8b99bae0b5b5abfab5561c3b09def28a2e0e14035c82eb54334613b85b64580d","observation_id":"7af8c7f2-fa1c-4076-8679-52e23dbc0aaa","resolution":{"observed_at":"2026-08-12T04:41:58.928534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.371720Z","title":"noise level","venue":null,"work_id":"d9855ba1-4936-41d6-a38e-f39cfde56cac","year":2023},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.933160Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:67d2332b07776007e19352bc265bc8f09f55781dd32a8c34cb5fb06ea2538ca3","observation_id":"fa0f9525-67a7-420f-9ef7-1b4819366448","resolution":{"observed_at":"2026-08-12T04:41:59.376610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.354891Z","title":"We train Model 2 for 100k steps and Model 3 for 150k steps","venue":null,"work_id":"15879d12-0bca-40d7-98e6-24cd1bb4e941","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.937880Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:ff8e794a8e87c2e0cb1536df1f6674f5cc392d4a170bb896ffb023b346b3ec51","observation_id":"a3430458-5820-4f57-8419-6ae832680308","resolution":{"observed_at":"2026-08-12T04:41:59.360078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.337542Z","title":"The learning rate under- goes a linear warmup in the first 1000 steps and a cosine decay throughout the rest of the training","venue":null,"work_id":"78563655-abf4-4c20-9f78-1873d62eb269","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.942469Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:878a9e14f65315c91a27c76d98fd677276f2e0b0dae3a6a7c3a53ec347310bef","observation_id":"4aadeaf1-2a5a-4820-9d50-4c249a7a6c8a","resolution":{"observed_at":"2026-08-12T04:41:59.342871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.321825Z","title":null,"venue":null,"work_id":"ad3d4df2-10e2-4b62-838c-811ce32364ab","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.947305Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:a830b961da2025f2e83d111045cb00cb76130924591909ad73f566cad85a7689","observation_id":"101711de-1266-4bde-ac93-14468eade4ea","resolution":{"observed_at":"2026-08-12T04:41:59.326555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.305817Z","title":"Instead, we sample p(x0 1, x1 3|x0","venue":null,"work_id":"11177997-4395-43a1-8d4c-f0bff94d02ee","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.951780Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:dc1bfd192c284791a15c261946cb4fe4b65533bf26b4c1f2c03137ac2b9efbb0","observation_id":"9c1ca971-3aae-47e7-9d6a-f6202be73e2e","resolution":{"observed_at":"2026-08-12T04:41:59.311749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.290459Z","title":null,"venue":null,"work_id":"f96a33f1-85f2-4393-b632-42a26af08870","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.956113Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:19ce88b70f615cca45931a0bc4af6229728e4dc8aafec2632af7222e348082b5","observation_id":"3013141e-f663-4032-a4db-591ae65de4bc","resolution":{"observed_at":"2026-08-12T04:41:59.295320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.275133Z","title":null,"venue":null,"work_id":"e9a01f94-59fc-41d9-a468-4c5a8f4b3a92","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.960838Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:9cb8c08574b5a3a776e5eb24ae571d99727d841548865c76674913f6c3efe096","observation_id":"09941fc5-c0b0-487e-ae04-fccce7b390b7","resolution":{"observed_at":"2026-08-12T04:41:59.279742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:41:59.259489Z","title":"car”, “bird","venue":null,"work_id":"0b90fbd2-6663-4b51-b778-9699916e21b0","year":null},"citing_paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T04:41:58.965498Z"},"links":{"citing_paper":"/paper/2412.01169"},"observation_digest":"sha256:bd71b1d556d9fc7d256a12916b16c6f4d037ac3f74027a92bdaff6694b54bd48","observation_id":"eac4a76c-4909-4193-a3ca-2a2102097928","resolution":{"observed_at":"2026-08-12T04:41:59.264520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.01169","last_updated":"2025-03-21T07:14:34Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-15T17:18:53.958468Z","submitted_at":"2024-12-02T06:13:01Z","title":"OmniFlow: Any-to-Any Generation with Multi-Modal Rectified Flows"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 7 inbound Pith citation observations for arXiv:2412.01169."}