{"as_of":"2026-08-10T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:93628a52f09f6535eef154d91e3e9464ce3dbb5196c2385ebedf2bbb3b94e8a8","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:06:15.946132Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06523/citation-record","integrity":"/paper/2507.06523/integrity","json":"/paper/2507.06523/citation-record.json","paper":"/paper/2507.06523"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.687113Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.687113Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:f57a7a2da302e405d8b3b8e3009a195945bb29ac2c862e6a5f2f7b20cd6fa2ce","observation_id":"5f283fee-f754-4199-a520-2ad4785a941d","resolution":{"observed_at":"2026-08-06T19:06:15.687113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.693631Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.693631Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:05ce841f844383e381318bbe94af7316521b92666f3ef618271da7281d4e9e21","observation_id":"7f550a32-eddc-4064-abf9-8368032a0864","resolution":{"observed_at":"2026-08-06T19:06:15.693631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T19:06:15.699508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.699508Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:afc9f46dc3fef5e37557475fac1e46458993b537f59d2e686d55fa09e051350c","observation_id":"bbe0cab4-82e0-4d31-9368-22ff14061d92","resolution":{"observed_at":"2026-08-06T19:06:15.699508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.671268Z","title":null,"venue":null,"work_id":"838054cd-dc73-4e80-b1e2-0eccd6205744","year":2005},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.705426Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:8f98cffdb3adafa79ee6b124f3c27d92ff975ae700fc160ed0a434d85cd2908e","observation_id":"e681670b-b311-404e-aeab-21af7942e34e","resolution":{"observed_at":"2026-08-06T19:06:18.766097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.484513Z","title":null,"venue":null,"work_id":"eac83aed-6f9a-44c2-9340-961c7b506bf1","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.712089Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:25325ed7188a31862d432adff2774a61105ba622fc499b77afc960489bd0f5c3","observation_id":"21d70a30-6f0c-461e-a05b-69ca07295eaa","resolution":{"observed_at":"2026-08-06T19:06:18.592460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T19:06:15.723799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.723799Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:bf0a60e1082b850ecc94c2015679ea43f0d27edf1d838fcfa3748e2776b51e7d","observation_id":"c75fc183-2605-4fd2-80c6-06dd9e14f443","resolution":{"observed_at":"2026-08-06T19:06:15.723799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.304100Z","title":"Baldridge, Roopal Garg, Peter Anderson, Ranjay Krishna, Mohit Bansal, Jordi Pont - Tuset, and Su Wang","venue":null,"work_id":"211bb3a9-1d38-41df-90d1-47059ecbbe51","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.729401Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:b3043fa59debb57bc7f5911cda4d0d67d8ee469eea6805d599393b84060fa5fa","observation_id":"9a317bad-2679-438f-9944-0b3fa063ef81","resolution":{"observed_at":"2026-08-06T19:06:18.373698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.132142Z","title":null,"venue":null,"work_id":"f0f5addf-fc2e-4a37-bc78-f9ea67ca9d9e","year":2021},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.735407Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:2d9686ec0bd105d646d1f37861ae244d28d8beedbb210282e14612a5b605d37e","observation_id":"5d9ac1fa-447b-4096-9d55-bb7f4b6b80f5","resolution":{"observed_at":"2026-08-06T19:06:18.195171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.977733Z","title":"Gritsenko, William Chan, Mohammad Norouzi, and David J","venue":null,"work_id":"3f73d927-3903-4ab2-8a68-80a215f634dd","year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.740511Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:d6692ddb315cb62725128d2fff04b0ccf2d67bbb0a940b58817049971bf6c4c3","observation_id":"6b04b152-ebe2-4c62-8d8c-bd54f382a8ca","resolution":{"observed_at":"2026-08-06T19:06:18.029151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.745427Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.745427Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:5897feca9c00bc0e9a5682f2b7bbc18d95e56ad6a272f634849d40ce24be2724","observation_id":"26821cb2-1457-4b6f-b88e-b31ba2ea080a","resolution":{"observed_at":"2026-08-06T19:06:15.745427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-06T19:06:15.750213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.750213Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:ce96cea166fc6387de3eae2dae9c2bb138d0b6f7ec66f9295fde31d357e51972","observation_id":"3d165508-a40a-4d30-8a19-eb5abef2d1ba","resolution":{"observed_at":"2026-08-06T19:06:15.750213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.800314Z","title":null,"venue":null,"work_id":"11adf8b9-68e1-400c-b862-0381cbedad7d","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.755347Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:a4cfecfd608b214baf4e5d114bd653fcbc1df55c5eb04784e80c9db79238cf0a","observation_id":"66c6bf8d-ac84-43b9-9ba5-eb7aa8674f7d","resolution":{"observed_at":"2026-08-06T19:06:17.886643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T19:06:15.760357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.760357Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:080cb5db325a1f81c36aae7dbfca4f7fe232e01d2859e537c693746ee4af86a5","observation_id":"65a6c944-d0cf-4eb8-bf74-521ac92acee3","resolution":{"observed_at":"2026-08-06T19:06:15.760357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.765679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.765679Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:74693f44798cf2df9beccd4eeb8f0045655ba972ca3e24cbb57b2b56f31132a4","observation_id":"1479f4e8-f67c-41d8-a65d-a0a6b06a3999","resolution":{"observed_at":"2026-08-06T19:06:15.765679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03735","last_updated":"2025-03-31T21:07:49Z","snapshot_observed_at":"2026-07-06T20:01:50.356653Z","submitted_at":"2024-12-04T22:03:19Z","title":"VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03735","snapshot_observed_at":"2026-08-06T19:06:15.770693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.770693Z"},"links":{"cited_paper":"/paper/2412.03735","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:10bb18d2872def0ea6cff76db46e1cb795e3ac740843992d13e9509ec1036837","observation_id":"ee748921-e4ec-4a1b-a389-d47b6ebf81e7","resolution":{"observed_at":"2026-08-06T19:06:15.770693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.775620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.775620Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:61ef787b4f73a10d7d13d63e81bd3d57b21b9897598486d5a805ef47e5ecfa9a","observation_id":"2740a068-c28d-4c68-81f5-3458d651095b","resolution":{"observed_at":"2026-08-06T19:06:15.775620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.780126Z","title":null,"venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.780126Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:edb7b480a0050cd82971f93d7333e45e9d3598cfc9d5c81d0ff17d0d1fba9e7b","observation_id":"a65af57c-b4f7-4f2f-9afa-3dfe8daa132c","resolution":{"observed_at":"2026-08-06T19:06:15.780126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.617830Z","title":null,"venue":null,"work_id":"ef504c3c-3747-464f-af14-c6109d259d13","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.785299Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:69fd081ae4fd9e05c2a83834ad6f481de3bbf222a418f769d1d609f433cd8fe5","observation_id":"96df4318-1a0b-4fac-baf5-fde92d9f40b7","resolution":{"observed_at":"2026-08-06T19:06:17.681986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.396221Z","title":null,"venue":null,"work_id":"b7e43bbc-4e6d-48c0-ac08-648dc681f195","year":2004},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.790896Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:491d3beb2b8a83c7848fbe48b360e099c4db6d4c5eba712331b4c3440923df83","observation_id":"7285bf6d-1e50-4717-924d-f74ea5189131","resolution":{"observed_at":"2026-08-06T19:06:17.502128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.206999Z","title":null,"venue":null,"work_id":"3a48b4bd-c509-4121-bfa4-ef59f71f6a25","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.796564Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:c1deb7120ba345882fa64d901ead52e9fb1b7f1c351f12b7399ef345a6099442","observation_id":"94ccacb3-d28b-43ba-b541-ed235b18fa4d","resolution":{"observed_at":"2026-08-06T19:06:17.311372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T19:06:15.801334Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.801334Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:462f8c00b2fe41f007f2d1f66ad1eb81e82db6f42c14f39fceed091db05857ff","observation_id":"bc9d5d64-ceae-413a-9f0d-684b13d764c2","resolution":{"observed_at":"2026-08-06T19:06:15.801334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.817135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.817135Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:a6adab6f33ed1d0dfb10117f555f9529d2d29498bf1a88d76bc64e967ccbde3f","observation_id":"fc8183c3-8b17-4b11-8bc2-f5f4cdcaba21","resolution":{"observed_at":"2026-08-06T19:06:15.817135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.822295Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.822295Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:990ce29722322bd6042f016d4b98d955f4afa023fd8baab01d5e2317b4d510bb","observation_id":"535a9d56-8216-4fe6-a09d-9266375f57f1","resolution":{"observed_at":"2026-08-06T19:06:15.822295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.829043Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.829043Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:f39b24e3213b4808f77944020a56aa6e3851eb82d13ada71831aa69a5e835857","observation_id":"5e193454-6832-4546-90af-830c051f850c","resolution":{"observed_at":"2026-08-06T19:06:15.829043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.834552Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.834552Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:333ab59ac520c033ecf9eeddf7b5295f0773b6af7ddc4a2ec8d361c815610627","observation_id":"ab604c38-9130-47f2-bae6-b8e8a484fd59","resolution":{"observed_at":"2026-08-06T19:06:15.834552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.032648Z","title":null,"venue":null,"work_id":"8cc67c04-7f4b-4e53-99bd-c20fb2854851","year":2002},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.839954Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:9783f44b05e0d25c54d7d907934abbea974ff8bbb96e8aab3f9efb5a7650f739","observation_id":"a777011d-2222-43bf-9b00-9ef36e32997a","resolution":{"observed_at":"2026-08-06T19:06:17.097973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10867","last_updated":"2025-03-19T18:53:09Z","snapshot_observed_at":"2026-08-02T22:09:23.477801Z","submitted_at":"2024-11-16T19:23:12Z","title":"ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10867","snapshot_observed_at":"2026-08-06T19:06:15.846144Z","title":"Sheth, and Amitava Das","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.846144Z"},"links":{"cited_paper":"/paper/2411.10867","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:e0ccc984a6c3527e82ba02906b2e9d88f83d79dda99f4dd0f42fe1ac67f4cd06","observation_id":"0820b5a3-e805-40ee-adce-0c285e84c68a","resolution":{"observed_at":"2026-08-06T19:06:15.846144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-26316-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":null,"venue":"Lecture notes in computer science","work_id":"d19a0455-b416-4115-aed7-fa65b3403ac1","year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.852275Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:c5bbe3bb609215b2a5e217d29a82ebbbd93f9c66e319e033c7730c729880dde8","observation_id":"a190fcd7-d05e-4ad8-a3d6-ff8aecbbda21","resolution":{"observed_at":"2026-08-06T19:06:16.257639Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:16.869273Z","title":null,"venue":null,"work_id":"090a0345-d51a-45c2-a6fe-1ccd3bb3414d","year":2017},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.857300Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:6b463da3066a086f7381eba6f09df4232b1724ad115a7346488ded3e2b6bc473","observation_id":"09911d56-2b23-4201-869b-d3e0edd0fb07","resolution":{"observed_at":"2026-08-06T19:06:16.947263Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T19:06:15.862734Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.862734Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:d2e2ff92b389b85152784535e2169f68fa0fb155b6587e6287a9b4e409c344d7","observation_id":"5e6c18e7-049b-4473-88b9-8a2bce9c2907","resolution":{"observed_at":"2026-08-06T19:06:15.862734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:16.740870Z","title":null,"venue":null,"work_id":"2a7e6611-ca66-4668-ac44-4735fc02a59b","year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.867653Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:ce3f5d7779cd58ea33617a90618d138dd8d69dfab028cd5eeda1ea7ee372f976","observation_id":"b474734e-525e-4d31-975a-47f6502592ce","resolution":{"observed_at":"2026-08-06T19:06:16.785779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-06T20:31:18.439488Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-06T19:06:15.872778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.872778Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:fc006aa941885390f90aadde31361a71a3652ffe5ef1114c4869ff6c2045bcf6","observation_id":"ec42d65f-0f14-4190-a446-33c46f45a37f","resolution":{"observed_at":"2026-08-06T19:06:15.872778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.877967Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.877967Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:66def95bf442c3dcfaf95564947b9d8f059c8f13876a36bc1bbd2abc7de49841","observation_id":"4a56766d-dc34-4a74-a1df-32c162be0325","resolution":{"observed_at":"2026-08-06T19:06:15.877967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.884147Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.884147Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:79ce31e89cd9783395b3eb413344fa2304f626b76d988c26f5fb48c5ca4b6fdd","observation_id":"94fa8b39-cfaf-4acc-91d7-8e80b70f8259","resolution":{"observed_at":"2026-08-06T19:06:15.884147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-07-06T17:15:42.343063Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-06T19:06:15.889647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.889647Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:01c52b1d9f1f80adb377d37989a39bd6023c36eec9e070f8a66b537af1a665aa","observation_id":"d94fbeeb-4f90-4105-8084-6e11203b2c68","resolution":{"observed_at":"2026-08-06T19:06:15.889647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.894820Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.894820Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:248dbfbc29c9ac1a3be5853190ddfb121c8be11e4679d137f508dbba2ec99e76","observation_id":"c6abdaa6-460c-499c-b7ca-a61acda16651","resolution":{"observed_at":"2026-08-06T19:06:15.894820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-06T19:06:15.900108Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.900108Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:b28e04070496addfa8af1ceb8cddf226728f4c9678eaa16b9f81e8a469bdb04e","observation_id":"fcd7c5f7-9d02-49eb-9039-f9e1fb35a32e","resolution":{"observed_at":"2026-08-06T19:06:15.900108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T19:06:15.905122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.905122Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:e7a97a04b1857a9122422b6c96ee3bb5d8125835edf85b53ecfa773701f6e3e4","observation_id":"b1647176-3413-4f66-a35e-eaf65c5ce11d","resolution":{"observed_at":"2026-08-06T19:06:15.905122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.910668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.910668Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:26bb7a16ecb00edcac8d1d3820fe6eab0e8c030a80f924935146f49b49615891","observation_id":"cb86b4e1-86ce-410b-9966-44437c9a19a8","resolution":{"observed_at":"2026-08-06T19:06:15.910668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.916208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.916208Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:6958f7e3b05faf281bb109b5412952b246eb5a9aab1f6a9294245ec4cc40a363","observation_id":"808e5899-ebd7-45e9-a295-ebc0cf4cdfc4","resolution":{"observed_at":"2026-08-06T19:06:15.916208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T19:06:15.921090Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.921090Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:512b8af52babc2fcfa2a72167b93e9de9b45b469073a1dcaea05d05020eae5b8","observation_id":"77fc295d-56e6-4f3d-9f43-01fd93e6e70a","resolution":{"observed_at":"2026-08-06T19:06:15.921090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.926034Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.926034Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:2b3074378091dfdd6989c3af886509e267e8a45e0103686ae59e85b57671d94c","observation_id":"0bdb533e-5eac-4116-9315-aa8c855dff17","resolution":{"observed_at":"2026-08-06T19:06:15.926034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.930986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.930986Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:92174b3ddf6ec5ae2af0cd5e518458b0328d493d611ad9c5fd109444de49927b","observation_id":"23f97203-057b-4b1f-875d-47c2b66a2ba4","resolution":{"observed_at":"2026-08-06T19:06:15.930986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.935424Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.935424Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:e0422ba2109da5d2d7283cb2c8452c7d7cc0a4d12d547f99cce1de854445f92c","observation_id":"90f60c04-8e70-4ec3-907d-3e5688c3aaf6","resolution":{"observed_at":"2026-08-06T19:06:15.935424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-10T02:47:20.223653Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-06T19:06:15.941028Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.941028Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:3351ba2cae66e9df923149b50dde9102cc60cf75552f900443c0d37d61402d68","observation_id":"2270874a-7514-4557-879f-293e7e4052f8","resolution":{"observed_at":"2026-08-06T19:06:15.941028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-06T19:06:15.946132Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.946132Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:6c1b3e9db03c600ad22a5150a900c3ac4f9fa89be161e9d17c04d4d5fb25ce4f","observation_id":"13e90a31-a301-4b87-b071-eadd88c43079","resolution":{"observed_at":"2026-08-06T19:06:15.946132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T01:54:57.345826Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2507.06523."}