{"as_of":"2026-08-19T20:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2934cf6a0309ad2203a75b165196baaaa338346453d865cd4301642a59d6a623","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:10:22.228795Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.09283/citation-record","integrity":"/paper/2412.09283/integrity","json":"/paper/2412.09283/citation-record.json","paper":"/paper/2412.09283"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.317531Z","title":"Chen and William B","venue":null,"work_id":"c1fed6b6-a75e-43f8-8125-6cb06e107d3e","year":2011},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.885108Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:c0027dfb8c281284da2cd1142dbd78306129f37dbe752955ac57271586833d6b","observation_id":"f098c3e9-9f2f-4ffc-ae90-4dc2769f8607","resolution":{"observed_at":"2026-08-11T17:10:53.322697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.301526Z","title":"VideoCrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"853f07b8-3bda-4af6-a082-12a9582070ba","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.891074Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:1c244062cec7529302afe3045b5b3456ef9055185738348422a65ab31b49549c","observation_id":"d57e239f-5270-4cfb-9c6a-ac55c55d4ef2","resolution":{"observed_at":"2026-08-11T17:10:53.306471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-16T13:45:24.844176Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-11T17:10:21.897243Z","title":"Sharegpt4video: Improving video understand- ing and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.897243Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:89d88790f5eec50a8261f815b55170753eeb299aa4388f07a2605d4f4516b3e0","observation_id":"4ebfefe2-7ddf-48c5-b74f-a80380af84ad","resolution":{"observed_at":"2026-08-11T17:10:21.897243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19479","last_updated":"2024-02-29T18:59:50Z","snapshot_observed_at":"2026-08-16T14:13:59.779732Z","submitted_at":"2024-02-29T18:59:50Z","title":"Panda-70M: Captioning 70M Videos with Multiple Cross-Modality Teachers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19479","snapshot_observed_at":"2026-08-11T17:10:21.903106Z","title":"Panda-70m: Captioning 70m videos with multiple cross-modality teachers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.903106Z"},"links":{"cited_paper":"/paper/2402.19479","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:8f12ae3bb2f9f65aa544d73485b51a0cd46390a240dd3190b4ff3b8f5eb00cce","observation_id":"85085582-55ce-400c-b4df-279fb124da4a","resolution":{"observed_at":"2026-08-11T17:10:21.903106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06350","last_updated":"2025-03-08T14:57:45Z","snapshot_observed_at":"2026-08-19T15:31:14.899929Z","submitted_at":"2023-07-12T17:59:42Z","title":"T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06350","snapshot_observed_at":"2026-08-11T17:10:21.909455Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.909455Z"},"links":{"cited_paper":"/paper/2307.06350","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:2634975b0b9fd514b7cd87fe6f38384b73d034dab671f30438a192766238db2a","observation_id":"d23350ec-f60d-4ba0-b2ce-ae3afb25ebc2","resolution":{"observed_at":"2026-08-11T17:10:21.909455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.285483Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"219666b5-d934-4cfd-8199-52faab2e95fe","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.915566Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:c0dea58bd8a781229bae4ecb0bf0183a454e2b0f35243ae916130b8c9ab892ba","observation_id":"1ec20df2-4806-43e7-802c-3ede21157525","resolution":{"observed_at":"2026-08-11T17:10:53.290914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.269398Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":"c2b6d61b-d6df-42e5-8d53-b938b3328300","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.920916Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:2e7ac6c42048ff443c104d262761a1c2a4325bed68a38a1a05ff95c454f1c919","observation_id":"8edaebb5-2364-49c7-81e8-10cffce4725a","resolution":{"observed_at":"2026-08-11T17:10:53.274241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:21.927418Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.927418Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:ee3721c0954f4361b76e19601b0e9b1ad8d7536ecf096f17bffa49d4c0ac8b1b","observation_id":"4c7fbfbb-a11c-4a9e-9d90-b56edcc76973","resolution":{"observed_at":"2026-08-11T17:10:21.927418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06358","last_updated":"2024-07-08T19:58:59Z","snapshot_observed_at":"2026-08-16T13:36:00.528382Z","submitted_at":"2024-07-08T19:58:59Z","title":"MiraData: A Large-Scale Video Dataset with Long Durations and Structured Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06358","snapshot_observed_at":"2026-08-11T17:10:21.932432Z","title":"Miradata: A large-scale video dataset with long durations and structured captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.932432Z"},"links":{"cited_paper":"/paper/2407.06358","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:414a796a050897a62738bade0baa84104ad277261a289ec98916332a5f03f709","observation_id":"5af02d9c-2cc1-411a-8e94-3e020a7ddb98","resolution":{"observed_at":"2026-08-11T17:10:21.932432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.252275Z","title":null,"venue":null,"work_id":"92d875dc-3228-42ec-89ae-53ff5d5ae301","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.937711Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:7e1a188624f7c27fd6fe23729978354acd5405f79882c0aebdc2ceb4b0dd6042","observation_id":"6118f070-b677-4b94-bfa0-8843cfd55cb1","resolution":{"observed_at":"2026-08-11T17:10:53.257171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.236094Z","title":"Open-sora-plan, 2024","venue":null,"work_id":"0109190e-2c20-4684-aee5-6b0729334138","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.942609Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:8888ba8bf5c8be7748885d5b4b2010f480545ca519a6ea4da93f1120f106c150","observation_id":"77183dd7-47d2-40e3-b7b2-6b85611a20a7","resolution":{"observed_at":"2026-08-11T17:10:53.241808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:21.947570Z","title":"T2v- turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design.arXiv preprint arXiv:2410.05677, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.947570Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:244e6667a7ad3022e2188dc2e564fbb1f051b623df1d23b7a032c3a331cc3477","observation_id":"af50f70e-e17f-423e-ae7f-d685af56199d","resolution":{"observed_at":"2026-08-11T17:10:21.947570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.218888Z","title":"Evaluating text-to-visual generation with image-to-text gen- eration, 2024","venue":null,"work_id":"3cbb1960-9036-4cc9-8934-7eb8a8d84291","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.952218Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:afac9c9041d4c2b3f9ffe235f9030eb5e2a1b42bf7553dfa78492144e9eaf031","observation_id":"4b43d96d-9d72-4105-866b-a4156803ea0e","resolution":{"observed_at":"2026-08-11T17:10:53.223906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11440","last_updated":"2024-03-23T04:58:50Z","snapshot_observed_at":"2026-08-17T07:59:34.011185Z","submitted_at":"2023-10-17T17:50:46Z","title":"EvalCrafter: Benchmarking and Evaluating Large Video Generation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11440","snapshot_observed_at":"2026-08-11T17:10:21.957349Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.957349Z"},"links":{"cited_paper":"/paper/2310.11440","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:c656d8dcf8b3d5f7c07b47799bb3b9670bf28201cde7a93de153d985f9ee7eb0","observation_id":"73ec0bcf-72e9-4f34-a786-a13eef6bfc78","resolution":{"observed_at":"2026-08-11T17:10:21.957349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-13T10:28:06.516901Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-11T17:10:21.963009Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.963009Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:72e30eab4fed0601f310344cb46a273d6835fa41fd217a563a445597fac4f0cb","observation_id":"fd21542b-0112-4ad1-99bd-b9d3eb2f66ab","resolution":{"observed_at":"2026-08-11T17:10:21.963009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-08-11T17:10:21.969388Z","title":"Openvid-1m: A large-scale high-quality dataset for text-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.969388Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:4fd903f5bb2adc598dff5e3aef0fc28c9fa8f033f561e9c024d4c29d397426a2","observation_id":"2c2e2bc9-c3de-4886-87df-a7dc1680c0ce","resolution":{"observed_at":"2026-08-11T17:10:21.969388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.200729Z","title":"Animal kingdom: A large and diverse dataset for animal behavior understanding","venue":null,"work_id":"7a9b7410-26d0-4e25-9c0a-5446c198d8dd","year":2022},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.975014Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:5ac9dcfaa359e922df7b2955e7102cad013f873f7e38e3f35538708ca0b8748d","observation_id":"fc576829-b7bc-4388-b783-e820dfee3991","resolution":{"observed_at":"2026-08-11T17:10:53.206937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.183824Z","title":"Pika 1.0","venue":null,"work_id":"9867deac-e3dd-4db1-9da9-255fb40bd6a4","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.980801Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:e33573a80cd4bdbbc6a8a1dbd3114aecbaab8b11e5329af480299962601a3fc5","observation_id":"0054ac26-a500-4ce8-910c-64dd8e702de0","resolution":{"observed_at":"2026-08-11T17:10:53.189391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.167353Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":"ddc5913b-fa60-46b4-9500-5028e75b75c2","year":2021},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.986290Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:1a29ef4f76ac3988db8e5624656456984120c61b64f4cabe70194be41d33b2b9","observation_id":"0ec2a843-92e2-4d53-a88b-bc84f7fd44a4","resolution":{"observed_at":"2026-08-11T17:10:53.172796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-11T17:10:21.991371Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.991371Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:8ae33c332940490534a9cba0747cc4d79bf693653d42afbe751a4b1e81cba60d","observation_id":"9bea47ba-645f-4e3f-b1da-5748cc258da8","resolution":{"observed_at":"2026-08-11T17:10:21.991371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.150416Z","title":null,"venue":null,"work_id":"2063336c-c455-4322-a041-ddd785c76846","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:21.996655Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:e3a0627ae980ad52124003cf3871bc2042310351ff105749aff40a97d319ce9b","observation_id":"ed6640e2-e24f-4d5d-aa8e-584e8ddaf2be","resolution":{"observed_at":"2026-08-11T17:10:53.156086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.131134Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"f9257069-0268-496e-a96b-c50cd1dfd026","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.003117Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:ce945030bdb48a4eefac63975f75724671e8244a8a46fe868da0e2f859cc272f","observation_id":"d9812e93-3ff8-40bc-bfca-468994f453ef","resolution":{"observed_at":"2026-08-11T17:10:53.137911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T17:10:22.008174Z","title":"ModelScope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.008174Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:6da547c1730c1ae770fc9a3b5c54e56e0f5195a0545d38fb04e92be1366f4482","observation_id":"fee51e57-7e0b-4dac-aff5-61ac3bdbaa7a","resolution":{"observed_at":"2026-08-11T17:10:22.008174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.108730Z","title":"Vatex: A large-scale, high- quality multilingual dataset for video-and-language research,","venue":null,"work_id":"89aac83a-a6e0-407c-9ae1-df75430dfefd","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.014362Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:32e77d122d68087207e4a082737b558864d04c1d352f71e6266c49301a7d8b51","observation_id":"9e21e2c1-3a3e-4bb0-bc4c-0e12308fd022","resolution":{"observed_at":"2026-08-11T17:10:53.114885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-17T12:21:00.357059Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T17:10:22.020323Z","title":"LaVie: High-quality video gener- ation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.020323Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:3c25108318c0ce42d4df5fa9ee4d8e1d3919ed311254ea87eb3b8cb457c9dc48","observation_id":"aa616b46-75ad-4d33-9d72-c21d88d7e1c5","resolution":{"observed_at":"2026-08-11T17:10:22.020323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.092051Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"85761c94-40d9-4031-a368-cde7d4924c03","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.030087Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:7fd4cd973c541425a9a26c66fa727286023b6f749253addc34874c23c8a7b4c2","observation_id":"7c4a398b-520a-4cc2-b9ba-31dfd64e4ff7","resolution":{"observed_at":"2026-08-11T17:10:53.097058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.073771Z","title":"Ifadapter: Instance feature control for grounded text-to-image generation, 2024","venue":null,"work_id":"1ef227c0-ad38-47c4-9341-d90c37322546","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.037006Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:cd5ab50e2264b3d9553c49c90f27587916af3f6a2e76405eb8f3785b18bd3823","observation_id":"95c1768c-6195-40ed-9b97-b37311e9020d","resolution":{"observed_at":"2026-08-11T17:10:53.079417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.056541Z","title":"Vript: A video is worth thousands of words, 2024","venue":null,"work_id":"098335d9-84c3-48a5-9e2e-269f79c9d391","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.042805Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:52d3d695021375092458d3ef04086694c9972c69024c3c7b3f22a534b7d8e124","observation_id":"6ac07ef2-95a5-4b98-a847-e3c1166cad5c","resolution":{"observed_at":"2026-08-11T17:10:53.061606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.040390Z","title":"Mastering text-to-image dif- fusion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":"737a0d56-654c-41e9-8cf3-fb45629c3e2d","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.055946Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:8bbf4a70f1a8eb8b673365e3c6811e051f2e699a7ac2536a22cab327ed94efe6","observation_id":"a450c8be-4544-4f05-b717-c9bd27bf6505","resolution":{"observed_at":"2026-08-11T17:10:53.045703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T17:10:22.062619Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.062619Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:383483df5201b9b0b3f51a4121ccd9160d2e931db5fa39132221cfd0ff102155","observation_id":"68f197f2-abba-4d39-9807-5a81253164fe","resolution":{"observed_at":"2026-08-11T17:10:22.062619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:22.069047Z","title":"Cpt: Colorful prompt tuning for pre-trained vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.069047Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:c819bb04d4ef1ae57ff74cf641e0d2fa1e6109a33b9c5fc7937a06f349cd7b0c","observation_id":"031a6f72-fe6e-42f0-ade5-027b6ab50fe2","resolution":{"observed_at":"2026-08-11T17:10:22.069047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:53.012730Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation","venue":null,"work_id":"84a05cb5-3d9a-4e30-8441-12877ca6d784","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.074359Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:84ec60a8df7a47ee81379dad23fd1be1e08950ed85753fd60ee44caaa8a0d5ef","observation_id":"5fa98523-e966-4445-9cde-15042c4c94a0","resolution":{"observed_at":"2026-08-11T17:10:53.018846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.996373Z","title":"Efros, Eli Shecht- man, and Oliver Wang","venue":null,"work_id":"f8f627fb-e7a0-4772-aebf-86727861f2ac","year":2018},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.081845Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:215429f314633f36a842e30e20c3d37e9d9841a50108946cd0e91c77aad00cb2","observation_id":"d19740f5-efad-4cb3-a74c-17647e40ea17","resolution":{"observed_at":"2026-08-11T17:10:53.002158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.978844Z","title":"Video instruction tuning with synthetic data, 2024","venue":null,"work_id":"f36f0637-560d-4f06-a169-5541be0a70c5","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.087507Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:600fb1f8bdfabc662dab808f49fc7c954230524588b16d095059e0f5512e17af","observation_id":"ca537b78-a784-43d9-9adb-6e20807cc484","resolution":{"observed_at":"2026-08-11T17:10:52.984990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.962632Z","title":"Open-sora: Democratizing efficient video production for all, 2024","venue":null,"work_id":"acbc4689-b55f-43dc-9e41-f8b8a6e4d1a6","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.095179Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:8a5afdf2fb15fcc2722bde09fe775d34b86cfbc1b31514e6579345bb68d742fc","observation_id":"f809e469-f5a1-44f6-a958-4e226d7f06e2","resolution":{"observed_at":"2026-08-11T17:10:52.968053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.946962Z","title":"Open-Sora: Democratizing efficient video production for all","venue":null,"work_id":"dd44339c-6274-4801-97d0-e5cfa25069c2","year":2024},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.101440Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:9a8f1c8c0030f0c30fd351fe7bb531c9ff0932aaf6666c1ad0e002829d9f195d","observation_id":"cc17b6b7-170b-4017-870e-873af743e6aa","resolution":{"observed_at":"2026-08-11T17:10:52.951776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.930347Z","title":null,"venue":null,"work_id":"94880bb8-40a8-480a-88e4-a7419e1e4cbf","year":2018},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.107772Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:af4bc6380426b3832d0311ec7546b8939eccc6cff46dd803e26aea0aeb0d1e79","observation_id":"95ddd32b-5419-4f6e-bcbd-1f2343d8fd40","resolution":{"observed_at":"2026-08-11T17:10:52.935738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.911167Z","title":"Detrs with col- laborative hybrid assignments training","venue":null,"work_id":"0dc5dbc7-c3f5-4cae-a878-8a52c1a4d6ab","year":2023},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.113084Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:cad092f6cb30e8054a33cccc9d4f8d4ee4ee316c1daeb280815d9c3c248aaae0","observation_id":"270d6517-3512-4130-80b8-5de4d34bb86d","resolution":{"observed_at":"2026-08-11T17:10:52.917077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.892877Z","title":"Conversely, we manually constructed a Negative Lexicon, which was further enriched using the powerful LLM, GPT-4o","venue":null,"work_id":"395dab42-5db5-4438-84c6-d2d5a59e7a3f","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.118425Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:f62823340f9f19f99fcec440f10789fddfc19d2164887d8cf045a330f7e0f050","observation_id":"318e6561-5430-4add-b673-a6b1154ef611","resolution":{"observed_at":"2026-08-11T17:10:52.899020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.876366Z","title":"Please describe the car by its color, make, model, condition, license plate (if visible), and any distinguishing features such as stickers, dents, or modifications","venue":null,"work_id":"87d059d0-f255-42c3-8978-cbeebdc0bce3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.125141Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:bc8fee25341a58265e52decc0062d8c4bc58eaa25d48fccbe7d023d1a561e269","observation_id":"73d602a7-17e8-4818-a477-2f4a5bf17aef","resolution":{"observed_at":"2026-08-11T17:10:52.881436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.861503Z","title":"Please describe this video in one sentence, no more than 20 words","venue":null,"work_id":"4d3ece89-6b94-4f5c-9def-a2556aae075f","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.130340Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:35f8bb9c9b26c184d1eb50f1f3c51be7884492929cf71fe4b9c52f2ab66abff2","observation_id":"231bd2a2-cb13-47c6-85f5-b7a4a6953f5b","resolution":{"observed_at":"2026-08-11T17:10:52.866461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.846309Z","title":"To pro- vide more precise instructions to LLMs, we meticulously designed multiple examples as part of the CoT, which are fed into the LLMs","venue":null,"work_id":"dfcec52e-016e-4823-8306-cb22a041aca3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.135176Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:34083c64a2137fc7675d21ce18922809959fa0c2776462a08f8ca6a939e390bb","observation_id":"57eef00a-8192-48ac-9c89-8e9d1f2d0758","resolution":{"observed_at":"2026-08-11T17:10:52.851374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.830354Z","title":"subject\" +","venue":null,"work_id":"670958fb-e06f-4758-8f81-bd24d6e978d3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.141222Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:2792fe6cfe79748893e661db13846ff7ddfaad3ae369f84c619eabdc07b68df2","observation_id":"05cacb38-087a-4f84-9b17-3324de6d7a87","resolution":{"observed_at":"2026-08-11T17:10:52.835383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.813383Z","title":null,"venue":null,"work_id":"181e804a-bcf7-4dd0-ac7d-fe09d177186c","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.146262Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:d2361b37301b28f742e63fa576fa70fc33cda397f97bbed84e71440336de1e83","observation_id":"88254254-5fef-4b45-a053-24043bc1c34b","resolution":{"observed_at":"2026-08-11T17:10:52.818327Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.798316Z","title":null,"venue":null,"work_id":"8dbfc395-5ca6-4fcc-a851-9800ab01eb3b","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.151056Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:bc9b207668d89f6f6a01f640984c1125488c0c0597b92c570e019b48cdef99ae","observation_id":"37a2c3dc-17c1-47f4-ac61-a21a0412bb15","resolution":{"observed_at":"2026-08-11T17:10:52.802974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.781560Z","title":null,"venue":null,"work_id":"4f3ed733-c210-4386-a735-b9cc62014091","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.156056Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:b9b141c4cf79dc66a8ec763841b3d18ddea240b6aab547ea72f2ee51dd997b16","observation_id":"86159046-675d-4300-944e-ae7f004f9195","resolution":{"observed_at":"2026-08-11T17:10:52.786731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.763138Z","title":null,"venue":null,"work_id":"21919682-b02e-40ed-b20e-a955dcdbdafa","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.160851Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:b7648f566c1e774097ba67f591f6da8db3bbf52877b1adead973cf5efabcc4d0","observation_id":"4b89d5ee-6326-4aa5-ad58-fce3b1848ceb","resolution":{"observed_at":"2026-08-11T17:10:52.767594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.749092Z","title":null,"venue":null,"work_id":"5baf11fa-aee2-4b01-a511-f02c27955b74","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.167400Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:ab7ca68813eb4b494aa7d036015c45d19ec60c56d70a8181d57d134f24259aba","observation_id":"09805f3b-88cf-4c9d-ad31-12813f0b514a","resolution":{"observed_at":"2026-08-11T17:10:52.753427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.733756Z","title":null,"venue":null,"work_id":"c19a669c-b903-4cd0-8dde-9eb959dab707","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.172740Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:3c1dca8a960bf5de17cf7b1253d5d9bd2296cef9635c970bf4ae28d7afcaccc9","observation_id":"68c54bb7-34e2-47d1-9e7b-eb28801a1685","resolution":{"observed_at":"2026-08-11T17:10:52.738613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.719452Z","title":null,"venue":null,"work_id":"e0a69e71-4f05-4b2e-a446-8abb9742f470","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.177978Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:33b3434e5f24bfa6003d6b1b739752e2fcaf9aeecc72bada07bc36629db87299","observation_id":"2733460a-5410-4e53-a018-d61641052d41","resolution":{"observed_at":"2026-08-11T17:10:52.723950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.705531Z","title":null,"venue":null,"work_id":"d3ed3df3-35f6-40d5-a0a9-1d6026eb1ed6","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.183120Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:2ab59cab0e79d92933a0141fda368cbe49c7b1a99a4f82096b090360f6e293c0","observation_id":"97ad5e53-6765-42f1-98b7-882556d71f13","resolution":{"observed_at":"2026-08-11T17:10:52.709918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.690659Z","title":"Global Description","venue":null,"work_id":"80878ff8-9839-4c2c-8778-4bcf1cdcf66a","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.188382Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:00faab495760b1d230b5a57f8c89dfed429c3776fcaef9e6a99e9623ca905e8a","observation_id":"ea38dc8d-3864-4df4-9681-ab08e95dbe5e","resolution":{"observed_at":"2026-08-11T17:10:52.695354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.675443Z","title":"3) Ex- trinsic Hallucination: Evaluate whether the text introduces content that is not present in the video","venue":null,"work_id":"e5676e2b-6229-4a9f-b0c0-bb8b0bdd6f58","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.193343Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:f707ac4b2ba9f0ee20c62b91a9f29b4f053fca6a2699752bc424b6c1d5e16ec8","observation_id":"6b3ff845-bbdb-4d94-a251-0079f1e3e7a1","resolution":{"observed_at":"2026-08-11T17:10:52.680131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.660704Z","title":"counter-intuitive","venue":null,"work_id":"e486b5e7-c76d-4709-be58-2401788bc21a","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.198272Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:6b29f7010e04f45084e38a7cb7ef284d4998a694b4479f06da7fda27ec05409b","observation_id":"c46daef7-2472-4254-905a-553e26f6af1c","resolution":{"observed_at":"2026-08-11T17:10:52.665365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.643317Z","title":",\".join([f","venue":null,"work_id":"3e4d6d3a-f93b-43db-8d0d-eb2549066040","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.202993Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:7e432c96a755f9e0b4f63f01c33ea6478c3cd7a7fefb1ef49015491750b790dd","observation_id":"02fd437d-b1f0-4537-bef6-fd4705d237b6","resolution":{"observed_at":"2026-08-11T17:10:52.648749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.626716Z","title":"subject\" +","venue":null,"work_id":"68a4530c-eb3b-41da-af2e-87b391f8adc4","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.208917Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:707090f2aecb7625bbc8dafc9d555cf88114df76e65e82fa2330f0c1141ae8a9","observation_id":"f2da4476-454b-4771-bfa6-fb07cec18eee","resolution":{"observed_at":"2026-08-11T17:10:52.631507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.609678Z","title":"The video shows","venue":null,"work_id":"c4081cb5-e93e-406c-8d01-48a8c37102c3","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.213643Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:9f8c14257ac0c18f4f98977041c37dd315a291de04335a01351605b29cf1db43","observation_id":"90cdd62c-75c5-439f-9dd4-c3f4f6cc0e8f","resolution":{"observed_at":"2026-08-11T17:10:52.614918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.592351Z","title":"A man... and a woman..., and a man","venue":null,"work_id":"841692bd-54a2-4529-843b-c7148081ab57","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.218481Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:27e3aafc8c4f2b6f6e78b02f451c9fb15b7d258271091d52429c93fcc7bd2f73","observation_id":"b486091b-22ac-4c79-92e5-72752dcde0a6","resolution":{"observed_at":"2026-08-11T17:10:52.596761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.576255Z","title":"The scene is","venue":null,"work_id":"18068ad7-a85a-4cda-940f-6b07d5235686","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.223004Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:954b836b05b6d04117e6ee887bd7d0f0c30a4388c17afc3224a492ed83d3d2b2","observation_id":"e2d51b3a-c5fb-4e9b-ba52-394fe430e6eb","resolution":{"observed_at":"2026-08-11T17:10:52.581473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:10:52.557162Z","title":"Aligning prompt used during alignment with the open source model","venue":null,"work_id":"8d66a2c8-594c-4a19-a030-24a079a0f1a6","year":null},"citing_paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T17:10:22.228795Z"},"links":{"citing_paper":"/paper/2412.09283"},"observation_digest":"sha256:327249bc6aa7a63476de6a72ac0100bb631472cd13e818fa884b25ddfa3ed36d","observation_id":"a1f40f2a-eb5d-465d-ae52-8fc043bcb8c4","resolution":{"observed_at":"2026-08-11T17:10:52.564812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.09283","last_updated":"2024-12-12T13:48:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T18:25:57.553914Z","submitted_at":"2024-12-12T13:48:40Z","title":"InstanceCap: Improving Text-to-Video Generation via Instance-aware Structured Caption"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":35},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2412.09283."}