{"as_of":"2026-08-18T19:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:590a74a0173c22b37b7aac3313155bb5826b745fda10b465e57730ccb6adc840","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:21:19.076614Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:21:47.529772Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T14:44:59.794530Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2506.10915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10915","snapshot_observed_at":"2026-07-08T14:44:59.794530Z","title":"M4v: Multi-modal mamba for text-to-video generation","venue":"cs.CV","work_id":"42351ceb-2a18-4578-ba0d-b855394cb673","year":2025},"citing_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-17T03:32:41.611109Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T19:19:42.748573Z"},"links":{"cited_paper":"/paper/2506.10915","citing_paper":"/paper/2505.17685"},"observation_digest":"sha256:9efbdd5afe211ac54f707ff73d5047a995708f1d387be4ea4876d8eb21f725eb","observation_id":"1ddb49fa-c4ac-44ed-ba10-04f8fbe71211","resolution":{"observed_at":"2026-05-15T19:19:42.932136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2506.10915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10915","snapshot_observed_at":"2026-07-08T14:44:59.794530Z","title":"M4v: Multi-modal mamba for text-to-video generation","venue":"cs.CV","work_id":"42351ceb-2a18-4578-ba0d-b855394cb673","year":2025},"citing_paper":{"arxiv_id":"2512.12598","last_updated":"2026-05-18T03:43:51Z","snapshot_observed_at":"2026-08-15T00:25:06.675630Z","submitted_at":"2025-12-14T08:35:04Z","title":"Setting the Stage: Text-Driven Scene-Consistent Image Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T17:40:25.779794Z"},"links":{"cited_paper":"/paper/2506.10915","citing_paper":"/paper/2512.12598"},"observation_digest":"sha256:0918399d7c6a859b912214b3e9081b72eb95c23af6de48aa650fe35671b9a5a9","observation_id":"d5ca2794-f90d-48c7-bbc9-01ec5835e62d","resolution":{"observed_at":"2026-05-21T17:44:17.287078Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10915","snapshot_observed_at":"2026-07-15T12:20:51.326210Z","title":"M4v: Multi-modal mamba for text-to-video generation.arXiv preprint arXiv:2506.10915, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08982","last_updated":"2026-07-05T04:50:20Z","snapshot_observed_at":"2026-08-15T09:05:06.117801Z","submitted_at":"2026-03-09T22:15:31Z","title":"SVG-EAR: Parameter-Free Linear Compensation for Sparse Video Generation via Error-aware Routing","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-15T12:20:51.326210Z"},"links":{"cited_paper":"/paper/2506.10915","citing_paper":"/paper/2603.08982"},"observation_digest":"sha256:5c1054e9491fe1ad5d4afe2ea29ff1f82e3bdb3860a91fa4986011c265029ea7","observation_id":"b685d287-2d41-4a87-bf75-cbe6f457ba16","resolution":{"observed_at":"2026-07-15T12:20:51.326210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2506.10915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10915","snapshot_observed_at":"2026-07-08T14:44:59.794530Z","title":"M4v: Multi-modal mamba for text-to-video generation","venue":"cs.CV","work_id":"42351ceb-2a18-4578-ba0d-b855394cb673","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2506.10915","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:acbf0cebc48d5400a4372ca385e5ab462841feaa7bf5edaca9f2c14d88b354fc","observation_id":"c8844a78-64e8-4506-aee1-dfe9f0ec77da","resolution":{"observed_at":"2026-05-11T11:11:00.767995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2506.10915","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10915","snapshot_observed_at":"2026-07-08T14:44:59.794530Z","title":"M4v: Multi-modal mamba for text-to-video generation","venue":"cs.CV","work_id":"42351ceb-2a18-4578-ba0d-b855394cb673","year":2025},"citing_paper":{"arxiv_id":"2607.06173","last_updated":"2026-07-26T20:43:47Z","snapshot_observed_at":"2026-08-17T16:14:36.725124Z","submitted_at":"2026-07-07T11:52:46Z","title":"MobileWan: Closing the Quality Gap for Mobile Video Diffusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T14:37:46.957265Z"},"links":{"cited_paper":"/paper/2506.10915","citing_paper":"/paper/2607.06173"},"observation_digest":"sha256:ff8885e2470ad4d5d77072cc2240707259c4f07c91d5bfb1fa8778f2b86589df","observation_id":"88582fc0-3acc-45a3-a988-110e9a377303","resolution":{"observed_at":"2026-07-08T14:44:59.795849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10915","snapshot_observed_at":"2026-08-02T08:21:47.529772Z","title":"M4v: Multi-modal mamba for text-to-video generation.arXiv preprint arXiv:2506.10915, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.06173","last_updated":"2026-07-26T20:43:47Z","snapshot_observed_at":"2026-08-17T16:14:36.725124Z","submitted_at":"2026-07-07T11:52:46Z","title":"MobileWan: Closing the Quality Gap for Mobile Video Diffusion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T08:21:47.529772Z"},"links":{"cited_paper":"/paper/2506.10915","citing_paper":"/paper/2607.06173"},"observation_digest":"sha256:e3dfdb6c5f8bf7d2fa09d0024959c27fa8a40db46a9d791a35ff315d3bc345fd","observation_id":"a0e029a5-6f1e-44f4-881e-082c12d34802","resolution":{"observed_at":"2026-08-02T08:21:47.529772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10915/citation-record","integrity":"/paper/2506.10915/integrity","json":"/paper/2506.10915/citation-record.json","paper":"/paper/2506.10915"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.780169Z","title":"Pika art.https://pika.art, 2024","venue":null,"work_id":"e5edee4d-4884-4ce6-ba43-58bca64a7d53","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.766104Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:75b63cfe1cbbc733bbdfd6c7719c0264c4192fb67d35ada7c4431c547d5679cb","observation_id":"f7e0ff73-8461-4a52-aea9-cda721dab9a0","resolution":{"observed_at":"2026-08-07T04:21:19.782774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.818385Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.818385Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:7c4d63543f455aff11b43ed7c49fe4792f579693b4c4dac42b2b14218b66b8f4","observation_id":"02eda61e-eb01-498f-8d63-e897e9cd6f46","resolution":{"observed_at":"2026-08-07T04:21:18.818385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.766980Z","title":"Flux.https://github.com/black-forest-labs/flux, 2023","venue":null,"work_id":"03956dfe-117f-4fd2-a1d6-2783ea111c47","year":2023},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.821935Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:42837279b73f70865e86dc5dc3aa39d3db5163099af20e0a56d4a3a5de635698","observation_id":"99b9b93a-2590-49e7-8816-6e57030e277d","resolution":{"observed_at":"2026-08-07T04:21:19.769840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.923561Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.923561Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:43153eca2a5eb38c5ccc41a3a7aa3b1e32f18a643b5859a791cb7b893c497abc","observation_id":"60d7f820-24d1-4853-af12-8bb281537e84","resolution":{"observed_at":"2026-08-07T04:21:18.923561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09626","last_updated":"2024-03-14T17:57:07Z","snapshot_observed_at":"2026-08-16T14:09:43.089136Z","submitted_at":"2024-03-14T17:57:07Z","title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09626","snapshot_observed_at":"2026-08-07T04:21:18.927125Z","title":"Video mamba suite: State space model as a versatile alternative for video understanding.arXiv preprint arXiv:2403.09626, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.927125Z"},"links":{"cited_paper":"/paper/2403.09626","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:58a682d503116e72a8ff45b95801262434ec2601af5bcf519dc09093a56d3443","observation_id":"be5e0b4a-7155-47a8-a2dc-e306aed9dd50","resolution":{"observed_at":"2026-08-07T04:21:18.927125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.934563Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.934563Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:956b1c8c54d406c578c0aefb7fb9e7607059e7f8a6961dc4996ca36c9eed84f1","observation_id":"ca55e251-000c-4ef7-aa51-3fa580c03782","resolution":{"observed_at":"2026-08-07T04:21:18.934563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-15T10:28:42.385124Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-07T04:21:18.937837Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.937837Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:c9d33620e5c639582f204cc28ef34028695eac692e1fcf576d3f011124e0004d","observation_id":"b2836212-e280-4e41-aa74-47852d59b0ec","resolution":{"observed_at":"2026-08-07T04:21:18.937837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-07T04:21:18.940770Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality.arXiv preprint arXiv:2405.21060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.940770Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:7a17c0479075c7e8c6b84a63b216dc642139671ae87baf471e9edfec5ea0290a","observation_id":"d86eef98-54df-4310-9284-7862710e3e4c","resolution":{"observed_at":"2026-08-07T04:21:18.940770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.943726Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.943726Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:af8de3a3f86112b596010b09ae1ee2bc97fb694b2dd1116e5a526cff7ceab419","observation_id":"d2dbefb8-b6ce-4d60-add6-3c613861d226","resolution":{"observed_at":"2026-08-07T04:21:18.943726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08453","last_updated":"2025-01-14T21:53:11Z","snapshot_observed_at":"2026-08-16T12:58:55.502275Z","submitted_at":"2025-01-14T21:53:11Z","title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08453","snapshot_observed_at":"2026-08-07T04:21:18.946935Z","title":"Vchitect-2.0: Parallel transformer for scaling up video diffusion models.arXiv preprint arXiv:2501.08453, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.946935Z"},"links":{"cited_paper":"/paper/2501.08453","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:907b7cf8e4babcd8a9501fa5926fa2f9f9cba6d3f4eb6cfb01b2cc6e8fdf0020","observation_id":"52f37071-c193-4085-8050-6f41ff3fbf83","resolution":{"observed_at":"2026-08-07T04:21:18.946935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01159","last_updated":"2024-06-03T09:51:59Z","snapshot_observed_at":"2026-08-16T13:46:49.329986Z","submitted_at":"2024-06-03T09:51:59Z","title":"Dimba: Transformer-Mamba Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01159","snapshot_observed_at":"2026-08-07T04:21:18.950027Z","title":"Dimba: Transformer-mamba diffusion models.arXiv preprint arXiv:2406.01159, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.950027Z"},"links":{"cited_paper":"/paper/2406.01159","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:a00b3c64afc507ba5c4a6a3fe8e3c2964c5d9b2e126a8aa97ffd36cbd460606d","observation_id":"e913141b-a757-4a09-a3fb-9a00293ffc7d","resolution":{"observed_at":"2026-08-07T04:21:18.950027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02615","last_updated":"2024-09-19T16:07:14Z","snapshot_observed_at":"2026-08-16T13:28:25.063485Z","submitted_at":"2024-08-05T16:39:39Z","title":"LaMamba-Diff: Linear-Time High-Fidelity Diffusion Models Based on Local Attention and Mamba","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02615","snapshot_observed_at":"2026-08-07T04:21:18.953995Z","title":"Lamamba-diff: Linear-time high-fidelity diffusion models based on local attention and mamba.arXiv preprint arXiv:2408.02615, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.953995Z"},"links":{"cited_paper":"/paper/2408.02615","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:9c631655af97f7130de77870609fdba22e61b608a5b6588b4a6329714200badd","observation_id":"47d6df64-ca99-4439-8328-8a0ffc12025e","resolution":{"observed_at":"2026-08-07T04:21:18.953995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03025","last_updated":"2024-05-10T08:30:07Z","snapshot_observed_at":"2026-08-16T13:55:15.359365Z","submitted_at":"2024-05-05T18:36:45Z","title":"Matten: Video Generation with Mamba-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03025","snapshot_observed_at":"2026-08-07T04:21:18.957450Z","title":"Matten: Video generation with mamba-attention.arXiv preprint arXiv:2405.03025, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.957450Z"},"links":{"cited_paper":"/paper/2405.03025","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:5328535fe41d90b20885dc55707972b07fbc0d5ed69708c2c9217c686780fbcd","observation_id":"ab791d2d-c81f-4b35-962c-1a12e938b4fa","resolution":{"observed_at":"2026-08-07T04:21:18.957450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T04:21:18.960505Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.960505Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:669c0455d01fc7599ec977db0de83477b58ee6a660ced402400e73a7506f5a25","observation_id":"d0462d30-c1b8-459d-be5f-85656edbcbc0","resolution":{"observed_at":"2026-08-07T04:21:18.960505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-07T04:21:18.963248Z","title":"Efficiently modeling long sequences with structured state spaces.arXiv preprint arXiv:2111.00396, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.963248Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:e9eb6661a00cc57c3ae84a2b265af6a0d246ca7572fe31bc6c9a346cfbea4e1d","observation_id":"27f80f9b-8858-4905-8597-1a94c3ee5496","resolution":{"observed_at":"2026-08-07T04:21:18.963248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.965955Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.965955Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:ea9d5ec9cf751683ffa2f5b5ad303b407f7359de3fb46970c4a8d4a57205b7c8","observation_id":"41e58600-93a5-434e-b8c8-c10c9be8c886","resolution":{"observed_at":"2026-08-07T04:21:18.965955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.968467Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.968467Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:8fff4fb931012267aa80f9560d8ef68ad36b481e38a8bebd1a7bc6d28bb5f87f","observation_id":"21ac86b8-ebd5-4013-ba11-9b4cc914480f","resolution":{"observed_at":"2026-08-07T04:21:18.968467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.733101Z","title":"Zigma: A dit-style zigzag mamba diffusion model","venue":null,"work_id":"3f0c5d65-5e17-43b5-b29b-d86a305d0285","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.970874Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:0cf8caedd8b8b878cfbb8ed820573858f5ce5113df9a63979f4c334723e97e14","observation_id":"1989c988-afa6-4980-a0f8-6a9d576cd81c","resolution":{"observed_at":"2026-08-07T04:21:19.735860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.973955Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.973955Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:48c23b6479d821827b8be5c0f395cb33c27b35f6df6ebff7f806e253c1241a17","observation_id":"541e0b5e-e90a-4676-a5c8-0afa488daf1a","resolution":{"observed_at":"2026-08-07T04:21:18.973955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.976415Z","title":"Flexvar: Flexible visual autoregressive modeling without residual prediction.arXiv preprint arXiv:2502.20313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.976415Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:33cec972f65c5ffc2b20b4ab366445b7199e9b769bc321f9898d2cc6d474a1db","observation_id":"3c43e290-8866-4bb6-b6bd-71e1d82d8cd9","resolution":{"observed_at":"2026-08-07T04:21:18.976415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.979380Z","title":"Pyramidal flow matching for efficient video generative modeling.arXiv preprint arXiv:2410.05954, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.979380Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:3e2a8702cc2db03ee0632935f0ffe2a9834557656394e51c50af31557c071a9d","observation_id":"c405f2ed-2f25-4181-8781-d7e6a222490c","resolution":{"observed_at":"2026-08-07T04:21:18.979380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T04:21:18.981813Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.981813Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:5aa156e280a16ce670e79df8a29260410f8b39ed0bd6e7bf66cdfe92219ff9d3","observation_id":"5cbb2112-205c-421a-a78b-d233b25cadff","resolution":{"observed_at":"2026-08-07T04:21:18.981813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.719840Z","title":"Kling ai: Next-generation ai creative studio","venue":null,"work_id":"cb6712af-80bb-4638-9399-f422f28db68b","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.984779Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:9ecbf421e2e4a3a3a933a070fb870b5239825ae8d65d298c14081af8100c05fd","observation_id":"422361a2-1844-4d90-9333-4de7887b0b8f","resolution":{"observed_at":"2026-08-07T04:21:19.722661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.711948Z","title":"T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback, 2024","venue":null,"work_id":"c3d89eff-d8e6-4c59-9362-30894700a8d6","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.987355Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:654404e4418660d4752ce1a58f5db63a14a0ab2954e194747f3058f662b1ce92","observation_id":"94e46e44-a5ea-40bb-99f5-4746d64d10ce","resolution":{"observed_at":"2026-08-07T04:21:19.714781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.703420Z","title":"Video- mamba: State space model for efficient video understanding","venue":null,"work_id":"221ceebb-41fb-4605-ad5e-1938b9983ab3","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.989749Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:e3e4fc3d1a322b9e5f7513f720c8f09a2e3ee11423527c4626b9bdc2b12606dd","observation_id":"8ce437a4-5be9-4f9c-b721-a44e9b081b60","resolution":{"observed_at":"2026-08-07T04:21:19.706303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.694854Z","title":"Mamba-nd: Selective state space modeling for multi-dimensional data","venue":null,"work_id":"e0614c71-daae-4e2f-9536-7d3e7c36d9b0","year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.992237Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:737ea4b1e1e3b95f9af2190b692c43ed0709d9eed8e761c21f79d2c9e2ffd5b6","observation_id":"4863e008-1a78-4d8b-bbff-98e69c3a0b9f","resolution":{"observed_at":"2026-08-07T04:21:19.697737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:18.995265Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.995265Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:fcf64557193690484f7babcbbd0f690f42f9fcd47b63b74166f13b1725e10b58","observation_id":"6f9e4cb6-9f41-4dc8-bb34-2620f93235b6","resolution":{"observed_at":"2026-08-07T04:21:18.995265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10248","last_updated":"2025-02-24T10:12:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-14T15:58:10Z","title":"Step-Video-T2V Technical Report: The Practice, Challenges, and Future of Video Foundation Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10248","snapshot_observed_at":"2026-08-07T04:21:18.998136Z","title":"Step-video-t2v technical report: The practice, challenges, and future of video foundation model.arXiv preprint arXiv:2502.10248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:18.998136Z"},"links":{"cited_paper":"/paper/2502.10248","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:f1ca2e5f4ee2bfa2faaf26607c7ba2d40353d269931902b400cb1b3d1c5117bc","observation_id":"7b53594f-2165-44be-81c2-4b4087fcd7d1","resolution":{"observed_at":"2026-08-07T04:21:18.998136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-07T04:21:19.001575Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.001575Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:c20713077a74c14536b142421ea796be2b1cb94d5b3a5e13c92d835d181d8ebf","observation_id":"023dacae-7917-461d-ae90-1b34abb3942a","resolution":{"observed_at":"2026-08-07T04:21:19.001575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.679556Z","title":"Ssm meets video diffusion models: Efficient video generation with structured state spaces","venue":null,"work_id":"3f9bd0c3-ef41-43c3-abd6-a505fcc753ff","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.004269Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:8cb984504bd915c5024c13bee51522e662fe9dd725e1ff436e01a6db0385767d","observation_id":"0a137ec2-b2a8-4e70-8aea-eb8bbe34de27","resolution":{"observed_at":"2026-08-07T04:21:19.683804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.007012Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.007012Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:f53c1109fc3c0d51f7257ad4b8f9034909ecf79b336fd48681abf16fc9208822","observation_id":"30ace87d-e10e-4458-8963-d32eda9a9100","resolution":{"observed_at":"2026-08-07T04:21:19.007012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.664361Z","title":"Open-sora plan.https://github.com/PKU-YuanGroup, 2024","venue":null,"work_id":"4f409e27-53a9-4272-8853-9d1899790685","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.009685Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:f16f9a93f7628f05a202fbe3a10bd7f0f0e94364e1298634839b91d68e1671ff","observation_id":"9baddb8e-b538-4417-a982-3ed0edcb66dc","resolution":{"observed_at":"2026-08-07T04:21:19.667407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20171","last_updated":"2025-05-26T16:12:41Z","snapshot_observed_at":"2026-08-18T01:48:22.016333Z","submitted_at":"2025-05-26T16:12:41Z","title":"Long-Context State-Space Video World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20171","snapshot_observed_at":"2026-08-07T04:21:19.012307Z","title":"Long-context state-space video world models.arXiv preprint arXiv:2505.20171, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.012307Z"},"links":{"cited_paper":"/paper/2505.20171","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:52eaa81e3c897a9f2a28f2b61167ef7bacd7a491d96a9f95464148d5666fac91","observation_id":"e1e3ebb6-ce29-4691-909f-4ef3eba43ed9","resolution":{"observed_at":"2026-08-07T04:21:19.012307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-08-14T22:54:08.184266Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-07T04:21:19.015208Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.015208Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:f38e4e9ebd6bd3d853d22d5685183c4550064c6c338bd3410ddd99fbce4b2c83","observation_id":"ecf29e05-1a33-40ec-9b37-7d0b6a5b09bb","resolution":{"observed_at":"2026-08-07T04:21:19.015208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.018003Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.018003Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:b6fd2fb9c122b53b4042cddb123b67c5d5436d3dd63e4f6055b37e16e1394253","observation_id":"39fd6d6e-3bb8-41e0-a0bd-d9233b1fe3d7","resolution":{"observed_at":"2026-08-07T04:21:19.018003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.649903Z","title":"Runway gen-3 alpha","venue":null,"work_id":"4795b79f-eee6-4643-904c-b75ae78a350f","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.020946Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:c3bf75f387c9f4e925c67fee9cb7babecf8939a6780f9f67ade840a6505ee893","observation_id":"80f53fd6-bffb-4f16-809e-235d7b0eef37","resolution":{"observed_at":"2026-08-07T04:21:19.652871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.023647Z","title":"Magi-1: Autoregressive video generation at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.023647Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:f8fa60e50762cc7d2f4f2d4cb3418e6e2941fc3be7791e70ed30b343f3d6e353","observation_id":"b61fb72a-947f-4612-96ff-5e04c7043793","resolution":{"observed_at":"2026-08-07T04:21:19.023647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.026438Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models.Advances in Neural Information Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.026438Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:6a22d7f3891e4cd956833afe719a8751b41e2c365ef51ae3edd6245dd55c39a3","observation_id":"c1071c26-d5f1-4673-a5bb-b29185aafc57","resolution":{"observed_at":"2026-08-07T04:21:19.026438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.029286Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction.Advances in neural information processing systems, 37:84839–84865, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.029286Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:a88859ecb0da12d29a8fc2e85de9cd51e1615675172ea7214779943f2842c0bf","observation_id":"88867a5f-f8c2-4761-8f0b-6ce70adbd41a","resolution":{"observed_at":"2026-08-07T04:21:19.029286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-08-14T07:06:06.462400Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-07T04:21:19.031951Z","title":"Diffusion models are real-time game engines.arXiv preprint arXiv:2408.14837, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.031951Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:23103d0c78f90ea0a26552006aae60a646dd938139194c77a8e0dadb69a8612d","observation_id":"171c0843-9364-489c-96cc-fade8b2e79fe","resolution":{"observed_at":"2026-08-07T04:21:19.031951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.035181Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.035181Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:ed809713ad216fd717a60f42ccf4b3ab7dd254152e93d8ca9e16bb8ca740aebe","observation_id":"e099cc7a-9241-4a4d-aac6-f382d5ea1d68","resolution":{"observed_at":"2026-08-07T04:21:19.035181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T04:21:19.037975Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.037975Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:fda5c60d9b9973bcc5b5cc479a1bc9307239b3b753c3e283143c47e8be992686","observation_id":"5d15457b-54ff-4f7f-a80a-bef5564c91a2","resolution":{"observed_at":"2026-08-07T04:21:19.037975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14858","last_updated":"2025-05-30T00:13:05Z","snapshot_observed_at":"2026-08-16T13:50:03.641505Z","submitted_at":"2024-05-23T17:58:43Z","title":"Mamba-R: Vision Mamba ALSO Needs Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14858","snapshot_observed_at":"2026-08-07T04:21:19.040852Z","title":"Mamba-r: Vision mamba also needs registers.arXiv preprint arXiv:2405.14858, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.040852Z"},"links":{"cited_paper":"/paper/2405.14858","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:e0e2c69bfe100a900a25bdaf96900450d6e1ba53ad46a9e2e47afc70e625506a","observation_id":"94382658-1a9c-421c-bc64-d13516b500fe","resolution":{"observed_at":"2026-08-07T04:21:19.040852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09856","last_updated":"2025-05-24T21:49:46Z","snapshot_observed_at":"2026-08-15T01:14:53.670017Z","submitted_at":"2024-12-13T04:55:10Z","title":"LinGen: Towards High-Resolution Minute-Length Text-to-Video Generation with Linear Computational Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09856","snapshot_observed_at":"2026-08-07T04:21:19.044277Z","title":"Lingen: Towards high-resolution minute-length text-to-video generation with linear computational complexity.arXiv preprint arXiv:2412.09856, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.044277Z"},"links":{"cited_paper":"/paper/2412.09856","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:b99d8b852b33e192797e01c9062e25cf749c001d62dd13717b1ea0758c025336","observation_id":"a8fe1376-17c3-4580-a606-0c671997fc7a","resolution":{"observed_at":"2026-08-07T04:21:19.044277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15237","last_updated":"2025-06-27T07:54:57Z","snapshot_observed_at":"2026-08-16T13:23:25.041410Z","submitted_at":"2024-08-27T17:56:11Z","title":"The Mamba in the Llama: Distilling and Accelerating Hybrid Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15237","snapshot_observed_at":"2026-08-07T04:21:19.047077Z","title":"The mamba in the llama: Distilling and accelerating hybrid models.arXiv preprint arXiv:2408.15237, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.047077Z"},"links":{"cited_paper":"/paper/2408.15237","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:fad2c4f742846894ae0be34800e39569a7783bd28173f5f019b08bf4f9a8eb67","observation_id":"3f89ebbd-a47e-45c7-bfcc-a5ded8772ed8","resolution":{"observed_at":"2026-08-07T04:21:19.047077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T04:21:19.050020Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.050020Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:50fff36dc1b5364031823fe88545529f5e838ba8d1f8e16c8c6f1617e4468c15","observation_id":"3f63a038-4859-4885-8140-f52aeea1ed68","resolution":{"observed_at":"2026-08-07T04:21:19.050020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.052703Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.052703Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:9312411f3441dff7d236aca18fae91fca5acf95f0f49d82a0fc6aa076c46681b","observation_id":"f2d4b2fe-03ae-4eda-987a-aacd6d430732","resolution":{"observed_at":"2026-08-07T04:21:19.052703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07510","last_updated":"2024-09-02T06:27:05Z","snapshot_observed_at":"2026-08-16T13:53:17.594054Z","submitted_at":"2024-05-13T07:10:53Z","title":"PeRFlow: Piecewise Rectified Flow as Universal Plug-and-Play Accelerator","version":5},"cited_work":{"arxiv_id":"2405.07510","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.07510","snapshot_observed_at":"2026-08-07T04:21:19.204573Z","title":"PeRFlow: Piecewise Rectified Flow as Universal Plug-and-Play Accelerator","venue":"cs.LG","work_id":"8ac044ce-66cb-4f7a-a823-9c1029a31461","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.055280Z"},"links":{"cited_paper":"/paper/2405.07510","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:aff4d34d6cf2f77766ff6b0456a7bc4a3b9bd6d4d7a9235980cab8273f96deae","observation_id":"1af791d3-81fe-4bb7-9d33-0780994358d9","resolution":{"observed_at":"2026-08-07T04:21:19.210398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.617261Z","title":"Perflow: Piecewise rectified flow as universal plug-and-play accelerator.Advances in Neural Information Processing Systems, 37:78630–78652, 2025","venue":null,"work_id":"05081f62-eedb-46a3-944e-eb26b3ed8c22","year":2025},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.058496Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:948d07d5b711691a529216d4c34a02119051b27999cf6cd8f9223da7d82c1dc4","observation_id":"d94db6d2-1b5f-4a17-b7fa-67133e896326","resolution":{"observed_at":"2026-08-07T04:21:19.620985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T04:21:19.061124Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.061124Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:ef94adc5ccabb6a25c1979aec5a03717158d20dbf3ef12b9cf31cfa308226467","observation_id":"a7078d3f-bea1-4375-a03e-4bb3a1a766d7","resolution":{"observed_at":"2026-08-07T04:21:19.061124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.063913Z","title":"From slow bidirectional to fast autoregressive video diffusion models.arXiv preprint arXiv:2412.07772, 2, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.063913Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:a87a76b77d92a6b4e695d8ce29d23ad525dbd6e6ab86f8afee9c963c831f9061","observation_id":"7481707c-e0bc-4de7-ba4d-7d075ff435f4","resolution":{"observed_at":"2026-08-07T04:21:19.063913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.608132Z","title":"Slca: Slow learner with classifier alignment for continual learning on a pre-trained model","venue":null,"work_id":"ed922caa-088d-41bd-bd8b-4b5a0889d1c7","year":2023},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.066663Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:27a7e715b774107e0dc07802f023ad84eaf42d1c5b22b25d30de8aae18c51ff8","observation_id":"e4ce0c0a-79f7-412e-9a5d-0d6c140088e9","resolution":{"observed_at":"2026-08-07T04:21:19.611061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08295","last_updated":"2024-08-15T17:50:07Z","snapshot_observed_at":"2026-08-18T05:52:55.800103Z","submitted_at":"2024-08-15T17:50:07Z","title":"SLCA++: Unleash the Power of Sequential Fine-tuning for Continual Learning with Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08295","snapshot_observed_at":"2026-08-07T04:21:19.069291Z","title":"Slca++: Unleash the power of sequential fine-tuning for continual learning with pre-training.arXiv preprint arXiv:2408.08295, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.069291Z"},"links":{"cited_paper":"/paper/2408.08295","citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:d7f2d05e648997f0355899bc967ddcb9346d785f9f406d9585e88df3ffdb7c9f","observation_id":"42402061-41fa-473c-a75e-9ddee9ec398c","resolution":{"observed_at":"2026-08-07T04:21:19.069291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.072026Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.072026Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:e72677feca553b2cd9946bad807aa5d66129dc608880f7796cf79ac934a406f3","observation_id":"2619e31e-1d85-4800-a19d-cecf3ed49f9b","resolution":{"observed_at":"2026-08-07T04:21:19.072026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:21:19.593467Z","title":"downward first, then rightward","venue":null,"work_id":"1a13383c-c981-450c-aba3-00682259e0e0","year":2024},"citing_paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T04:21:19.076614Z"},"links":{"citing_paper":"/paper/2506.10915"},"observation_digest":"sha256:062e20da0cc5cc73bd8917d54b0a47277678ddda6c0953bdfe9c1fb3db87338d","observation_id":"2b5bfff9-1850-44ec-8009-ef5e87941f61","resolution":{"observed_at":"2026-08-07T04:21:19.596314Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10915","last_updated":"2026-07-10T04:56:00Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T21:56:15.129029Z","submitted_at":"2025-06-12T17:29:40Z","title":"M4V: Multimodal Mamba for Efficient Text-to-Video Generation"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 6 inbound Pith citation observations for arXiv:2506.10915."}