{"as_of":"2026-08-14T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69b29ec88bc45857e2718588889a89fd9865a1377695d0926a969ea8a14ef532","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:02:26.319596Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:05.574108Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:00:19.327534Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18314","snapshot_observed_at":"2026-08-06T15:29:05.574108Z","title":"Agav-rater: adapting large multimodal model for ai-generated audio-visual quality assessment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15709","last_updated":"2025-08-10T13:31:03Z","snapshot_observed_at":"2026-08-10T08:52:34.323238Z","submitted_at":"2025-07-21T15:17:01Z","title":"Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:05.574108Z"},"links":{"cited_paper":"/paper/2501.18314","citing_paper":"/paper/2507.15709"},"observation_digest":"sha256:08220c982538e83e2cafa124b117ca16aa4fb7778d80d757302dc8b04dac00a1","observation_id":"13e43b0e-11d7-4144-a940-7bd6e6e57ace","resolution":{"observed_at":"2026-08-06T15:29:05.574108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":"2501.18314","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.18314","snapshot_observed_at":"2026-08-06T05:00:19.327534Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","venue":"cs.MM","work_id":"64c9e5d8-4707-4a0d-98bc-aad8ec429f91","year":2025},"citing_paper":{"arxiv_id":"2508.02516","last_updated":"2025-08-10T13:22:26Z","snapshot_observed_at":"2026-08-13T09:27:29.266977Z","submitted_at":"2025-08-04T15:21:29Z","title":"Engagement Prediction of Short Videos with Large Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:00:14.789121Z"},"links":{"cited_paper":"/paper/2501.18314","citing_paper":"/paper/2508.02516"},"observation_digest":"sha256:c8838b735827575b14dd412a3f7384a72f99e521b9c9fb12044fc2a9b2868f8d","observation_id":"cfc4fff1-41c7-4d93-badb-65f6addd245b","resolution":{"observed_at":"2026-08-06T05:00:19.331823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18314/citation-record","integrity":"/paper/2501.18314/integrity","json":"/paper/2501.18314/citation-record.json","paper":"/paper/2501.18314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.196499Z","title":"Prime Voice AI, 2023","venue":null,"work_id":"fff4ff23-f65a-4934-bee8-fc887cb784eb","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.074865Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:161ec45503f5b3bef257dd40e297de8b43bb6d8044c9a812a60527d7e90121fc","observation_id":"fdf31bf0-5965-4ee2-8d37-07a1a9098af5","resolution":{"observed_at":"2026-08-10T00:02:27.200658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.183109Z","title":"Accessed December 28, 2023 [Online] https://www.pika.art/, 2023","venue":null,"work_id":"f19cd6a1-b462-4d7e-b326-ee5c0841ceee","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.079755Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:d90a81a4a2a59c63226c2fe5ae75f25793e73cba0a86b60ac6aea5968703579b","observation_id":"7c0b15e2-e613-4299-bc34-ce60acd262d7","resolution":{"observed_at":"2026-08-10T00:02:27.187743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.171438Z","title":"Accessed June 17, 2024 [Online] https://runwayml.com/research/introducing-gen-3-alpha, 2024","venue":null,"work_id":"b16b48c8-a233-4048-b296-71ac766cdeef","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.083409Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:e9832a072c5a7f8c8e934185c3d16dea74373646807200cb99ddb7dd0f29c97d","observation_id":"21cbe542-4314-4966-a68f-7f2eb23af791","resolution":{"observed_at":"2026-08-10T00:02:27.175505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.159951Z","title":"Accessed June 6, 2024 [Online] https://klingai.kuaishou.com/, 2024","venue":null,"work_id":"f49e9aa2-7fa3-47b0-88a4-20795a38e65e","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.086752Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:7bd935969b0bddf5dfb16eba59f84027aa30414bf23c388b71db4caa5db92be2","observation_id":"46e2f2ee-4c14-4881-a339-80f2d8423dca","resolution":{"observed_at":"2026-08-10T00:02:27.164098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.148240Z","title":"Accessed February 16, 2024 [Online] https://openai.com/sora/, 2024","venue":null,"work_id":"59675cbc-2f4f-4623-b1dd-8467a289c2fd","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.089994Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:97901b406787dc6cae025ffa0ab2e767f5e325a5f0307d2e140daeab34520604","observation_id":"92a46a10-49f5-4508-8728-34d5a329ffb4","resolution":{"observed_at":"2026-08-10T00:02:27.152193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-13T17:15:19.591196Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-10T00:02:26.093378Z","title":"I., Borsos, Z., Engel, J., Verzetti, M., Caillon, A., Huang, Q., Jansen, A., Roberts, A., Tagliasacchi, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.093378Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:5b9d824d59d2bf017445846dc54cd2809545475870016bcecc4dea583224f640","observation_id":"67604226-62bc-4995-8c68-4cb83de72b8f","resolution":{"observed_at":"2026-08-10T00:02:26.093378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.137243Z","title":"G., Schmidmer, C., Berger, J., Obermann, M., Ullmann, R., Pomy, J., and Keyhl, M","venue":null,"work_id":"41eed6e6-781b-44ab-b9d7-81869e842297","year":2013},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.097895Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:148d3495c86a1583676e459615563b8eee3c77c7475c962d1910ebcdb6d927d8","observation_id":"54079295-2452-42d4-aea7-2fe544a8b568","resolution":{"observed_at":"2026-08-10T00:02:27.140844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.126614Z","title":"Attention-guided neural networks for full-reference and no-reference audio-visual quality assessment","venue":null,"work_id":"fc0e6778-9b97-42ed-92b8-b7b5f5237dee","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.101036Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:410e2c1d22aa828321e9f293181a237c42e7e985b88d280238aea16d2c06326d","observation_id":"b5aba429-cc3e-46f8-adc6-3f7f1351b3d9","resolution":{"observed_at":"2026-08-10T00:02:27.130287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.115202Z","title":"Subjective and objective audio-visual quality assessment for user generated content","venue":null,"work_id":"2c474687-cb10-4d29-bee5-1230ae6dc83f","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.104801Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:be8ff1fe0ad2ef63a68b6c72c791472b67e0bb152f95f3ce84141744c19294c5","observation_id":"0b5b111c-0ede-4c07-8e30-3bce1046ada1","resolution":{"observed_at":"2026-08-10T00:02:27.118856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16305","last_updated":"2024-04-26T02:23:24Z","snapshot_observed_at":"2026-08-13T00:22:38.018895Z","submitted_at":"2024-04-25T03:14:49Z","title":"Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16305","snapshot_observed_at":"2026-08-10T00:02:26.108555Z","title":"Semantically consistent video-to-audio generation using multimodal language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.108555Z"},"links":{"cited_paper":"/paper/2404.16305","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:c46f2597c223ad191118fd820c53013d8fb99598a693682a94252c5dca94aa67","observation_id":"f8009c33-1708-4b14-8d49-2048beb884b1","resolution":{"observed_at":"2026-08-10T00:02:26.108555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.104422Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"2b130b07-e6f4-43c3-a37a-0e898014247f","year":2020},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.112847Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:b0ab7499ded7bc4745ccbcc305af02e26b68dce3fe713e57a96094c4017380fe","observation_id":"9f910086-50e1-41d5-bf02-9b05428547b6","resolution":{"observed_at":"2026-08-10T00:02:27.108116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.092395Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":"43961d49-3882-4d8b-997a-628b80e271d5","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.116824Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:76f3a69e3e866ec19e78cd3e25beffe54866bae4afa60cec9e1024fce6c9b57b","observation_id":"f0af9eec-e1f8-4f70-a573-8304309ffba5","resolution":{"observed_at":"2026-08-10T00:02:27.096437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T00:02:26.120459Z","title":"VideoLLaMA 2 : Advancing spatial-temporal modeling and audio understanding in video-LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.120459Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:7cc14e4d5153d9f1bc2ac763def5d741c7f615252e42a1a18e0de6b3ac81772f","observation_id":"9da84270-4d0e-43ae-a854-9f56b0425268","resolution":{"observed_at":"2026-08-10T00:02:26.120459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.080172Z","title":"Simple and controllable music generation","venue":null,"work_id":"99167179-4c8a-4dd5-a153-49ae96c4288c","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.124527Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:207e44e74848019439e671fa2f350cd633f5692a1bd73c21f0999dae53dd9c17","observation_id":"8c990ca2-3e07-4f28-81de-fabe653a10d8","resolution":{"observed_at":"2026-08-10T00:02:27.084185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00282","last_updated":"2024-02-01T02:15:59Z","snapshot_observed_at":"2026-08-13T04:29:37.210189Z","submitted_at":"2024-02-01T02:15:59Z","title":"PAM: Prompting Audio-Language Models for Audio Quality Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00282","snapshot_observed_at":"2026-08-10T00:02:26.128138Z","title":"A., Singh, R., Raj, B., and Wang, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.128138Z"},"links":{"cited_paper":"/paper/2402.00282","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:77c7da05176d86eecc6d578bad9845143f709af1cef8466b9ad581743a4ae7f3","observation_id":"b185952f-2392-43f5-a3e2-bff21ac70847","resolution":{"observed_at":"2026-08-10T00:02:26.128138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.067728Z","title":"Toward universal text-to-music retrieval","venue":null,"work_id":"a22935be-3a92-47e9-a97e-5d8dd92d233c","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.132102Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:92c13eb5e147826a7daf88299cd17e61d7bcc12af80e3375013d3d20d4cadc4f","observation_id":"5ea53f22-e938-4b26-8d79-e8b12116018a","resolution":{"observed_at":"2026-08-10T00:02:27.071912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.054631Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"baccb277-4901-4dd8-b010-f6f929c9b234","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.135897Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:07691ec06018b82d6408f8d3c286b45be3f81aeb825a015cfd120264b9877bb7","observation_id":"9aaf1ed9-a3e1-4064-9eb8-702427f8af1f","resolution":{"observed_at":"2026-08-10T00:02:27.059316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-12T23:05:52.455854Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-10T00:02:26.139518Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.139518Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:6e75cd6614ddfd243ec448bdaadd0ccfd17048587e46bc8ea8a3beb11fec0d0a","observation_id":"7b3f034a-05a7-460c-97fd-1be3d9d0069f","resolution":{"observed_at":"2026-08-10T00:02:26.139518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15447","last_updated":"2025-08-12T04:20:41Z","snapshot_observed_at":"2026-08-12T14:15:26.579700Z","submitted_at":"2024-11-23T04:27:19Z","title":"Gotta Hear Them All: Towards Sound Source Aware Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15447","snapshot_observed_at":"2026-08-10T00:02:26.143618Z","title":"Gotta hear them all: Sound source aware vision to audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.143618Z"},"links":{"cited_paper":"/paper/2411.15447","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:38b2e088b30d676a24ff9926fe13a1d280bf2038698e835073a0bce465a99133","observation_id":"f2e25c47-60b7-42a2-a8ee-70597ef18393","resolution":{"observed_at":"2026-08-10T00:02:26.143618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.042422Z","title":"AnimateDiff : Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"4b9290ef-6daa-48ba-9137-e365b0aa8244","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.147525Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:f9202e3504d4da2559a4f282c6c53d453b7093c5c323ba1a688baa6a213f0a93","observation_id":"b1a8fd6b-f6cf-41f4-a5d7-5944ee8d1e82","resolution":{"observed_at":"2026-08-10T00:02:27.046444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.030937Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":"9ad36695-855d-4761-96ad-2ccd9023f9de","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.151192Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:8d9f5bffec39e8d0b1752c6da0cc06f37d64fb2e84a1e24f0c603b9dace097c8","observation_id":"95381a4c-0dce-46b3-b59e-285693eb614e","resolution":{"observed_at":"2026-08-10T00:02:27.035546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.019157Z","title":null,"venue":null,"work_id":"3f1cc7af-f973-4116-be3a-dac33fc7415b","year":2007},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.154855Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:8d62a26d5e7ff949dde2d5f95bf77bcf8339d041a00de447a88dd0fc46e8799a","observation_id":"9cc67da7-92c8-46f2-a49a-51bac96a791f","resolution":{"observed_at":"2026-08-10T00:02:27.023540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-10T00:02:26.158614Z","title":"CogVideo : Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.158614Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:76eec632a878016090e2eb83c9647d50c67e0d0651c44a1ea83e499ffe7b4a12","observation_id":"cefd2335-c222-4665-a4ee-3d47f23f13af","resolution":{"observed_at":"2026-08-10T00:02:26.158614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14709","last_updated":"2024-09-23T05:05:47Z","snapshot_observed_at":"2026-08-12T22:39:54.265826Z","submitted_at":"2024-09-23T05:05:47Z","title":"Video-to-Audio Generation with Fine-grained Temporal Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14709","snapshot_observed_at":"2026-08-10T00:02:26.162701Z","title":"Video-to-audio generation with fine-grained temporal semantics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.162701Z"},"links":{"cited_paper":"/paper/2409.14709","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:3ddc4a109fdd5209570cf91729a395eee7b6650d3699b97630af48d6d4a1ee1c","observation_id":"53accb63-7a54-44d1-bfd5-4d6a6c717ec7","resolution":{"observed_at":"2026-08-10T00:02:26.162701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.005194Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"c59e0fe5-552c-4711-8422-34eab90ec126","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.166500Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:cdab5f6bff1acec0ffeaf79873d2130dda9764ea2bfa39318fe5889ef8bc5577","observation_id":"5d45ad44-df55-4936-996f-d2a5faf2cf52","resolution":{"observed_at":"2026-08-10T00:02:27.009115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T00:02:26.171351Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.171351Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:2322df70b0366a57d8f2ef29daafc5e02e9fbc449f10c75433be2850b8c2547e","observation_id":"073488ba-5728-47ff-9e5d-05e5cf7d8ba3","resolution":{"observed_at":"2026-08-10T00:02:26.171351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-08-13T17:51:47.592172Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-10T00:02:26.175169Z","title":"and Rahtu, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.175169Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:df515fb8813efd38b05d8c5ec7d4d3f62590b3863e448d13501a9dbe9f0b7c27","observation_id":"e6f7b572-5f85-4443-939e-3414a4ad8fa8","resolution":{"observed_at":"2026-08-10T00:02:26.175169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.993048Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":"a75713a7-ec1e-4419-aa22-24e6d6d9f128","year":2025},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.178962Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:a42b099de3c9563415d0463b8cdac431e2fde2b148ae85cf781102b7e951917f","observation_id":"ad621faf-ae9f-4405-9a81-1df5f46d6ee6","resolution":{"observed_at":"2026-08-10T00:02:26.996922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.981391Z","title":"T2VBench : Benchmarking temporal dynamics for text-to-video generation","venue":null,"work_id":"20df1f41-33e9-4cce-b76d-25f3f38a6d3a","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.182673Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:0a8b0c986eadf5f04af275c422e490e8352abdf285e63a69abcec772927e7603","observation_id":"76f07674-9edd-45ae-86cc-f7209d1b0187","resolution":{"observed_at":"2026-08-10T00:02:26.985567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.969000Z","title":"D., Kim, B., Lee, H., and Kim, G","venue":null,"work_id":"161486ed-045c-4195-8f17-50b4d6e8a3a7","year":2019},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.185848Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:4af7f810c85dd4b67b2c1334a96346c86ac5b427a57c9fa7bdcd4be11a7cb13e","observation_id":"405c95da-158c-48a6-90e4-7c1e87db9807","resolution":{"observed_at":"2026-08-10T00:02:26.973264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.957931Z","title":"Subjective-aligned dataset and metric for text-to-video quality assessment","venue":null,"work_id":"2da2bbea-ceeb-47dd-b449-ae22639c6b7f","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.189063Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:93a20860bc80cacdafaba4b02398cc2747a1afa528812d0772d7f8021e21a6d0","observation_id":"bc894573-ea6a-4ad9-8454-bd76e50531c5","resolution":{"observed_at":"2026-08-10T00:02:26.961500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-13T14:15:37.919179Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-10T00:02:26.192304Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.192304Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:ef5e5cda5ba2953678fff229612768ea58e5a2f7b6709b675051ed22173b242d","observation_id":"0423f0dc-9b3c-48f9-9046-375a6fed13ca","resolution":{"observed_at":"2026-08-10T00:02:26.192304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.947184Z","title":"Groundinggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":"265fddfc-5496-4bcc-aabd-760a2d55e7c9","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.195824Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:c4460de0c8994f45a18e35f63d907c02e810dd5e7c9e1dbe388a6ea1614250df","observation_id":"71c8e2b8-dd21-450b-910e-5d819958bc9a","resolution":{"observed_at":"2026-08-10T00:02:26.950750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.934632Z","title":"VALOR : Vision-audio-language omni-perception pretraining model and dataset","venue":null,"work_id":"bf771e3e-4de2-419a-8774-dd47a5a933c6","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.199202Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:635d66ddf86322fdb0bcf4c3b57db59bcf5bd3b9db568f8ef07a94e53e02dfb7","observation_id":"25eba396-9234-4e1d-b685-16c12c5f394d","resolution":{"observed_at":"2026-08-10T00:02:26.938998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.921460Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video generation","venue":null,"work_id":"8029d26c-f532-4947-90e3-b0c6b71180eb","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.202480Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:f1837271d7c00ad1395f7690f289f5e93e230a0f263651a8473dcdbcded51e09","observation_id":"d14bee3c-402e-427f-820d-a7e57fb52728","resolution":{"observed_at":"2026-08-10T00:02:26.926543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.900820Z","title":"Mosnet: Deep learning based objective assessment for voice conversion","venue":null,"work_id":"736673ea-8e99-4488-989b-4acffcf57c79","year":2019},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.205464Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:d4de7dd585e6ce15e633e6ca0361d3139fc6968b8ca3566c3eeee6d2add68238","observation_id":"4f97cb71-53a0-442b-ae76-0286d41da35d","resolution":{"observed_at":"2026-08-10T00:02:26.908571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.881029Z","title":"Unified-IO 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"11bbb27c-435d-4605-a0f9-fa9b56b27fea","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.208314Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:791606c0023b847d1732f1ef746082fa2673851444573e5a70ba3a51b9e9eb1c","observation_id":"e32b041a-0311-420d-8a11-f4ef76a4ad8f","resolution":{"observed_at":"2026-08-10T00:02:26.890302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.859711Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models","venue":null,"work_id":"2ee21ec0-f804-4b54-9a43-3006002c3132","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.211651Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:4f97ed9111970ed7c1b38d2939e876184c613a9063f35e3d443a478f15bcf252","observation_id":"9de5644b-981c-4461-9eb9-988615a2d865","resolution":{"observed_at":"2026-08-10T00:02:26.864803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.12285","last_updated":"2022-06-24T13:34:53Z","snapshot_observed_at":"2026-08-13T15:17:29.209423Z","submitted_at":"2022-06-24T13:34:53Z","title":"Speech Quality Assessment through MOS using Non-Matching References","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.12285","snapshot_observed_at":"2026-08-10T00:02:26.215147Z","title":"and Kumar, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.215147Z"},"links":{"cited_paper":"/paper/2206.12285","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:bc652ae8bbfd47dbca0f47c61c5f6f6ce1a3c079001ff5148cc99374a1fbfcfa","observation_id":"781d5118-91c8-4bd0-859c-7de8313a11cf","resolution":{"observed_at":"2026-08-10T00:02:26.215147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.843950Z","title":"C., and Bovik, A","venue":null,"work_id":"7e36aa65-cd1d-4fcb-b726-6e8f34b6cdb5","year":2020},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.218837Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:53640aaf9c2695eef44263f4a561ba369bc46838155619062036f9a80cb7a0d5","observation_id":"87d68138-c513-4a26-8ed8-011dae96b6dc","resolution":{"observed_at":"2026-08-10T00:02:26.849603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.825351Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets","venue":null,"work_id":"828f12dd-34cf-4e46-8a48-2ddaf1d420dd","year":2021},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.222182Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:61ed0a5acd20bfb1dd0382f9161e9607c0d94e776b4a1474dd33af273be58a53","observation_id":"f69d7519-19da-4049-a174-c2f0afd16265","resolution":{"observed_at":"2026-08-10T00:02:26.831081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.810354Z","title":"Audio-visual instance discrimination with cross-modal agreement","venue":null,"work_id":"076fea87-5164-45c2-9684-96ff06497dbe","year":2021},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.226070Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:6f8412b199abfb1799a76fcafd50fa200909fca4605b247d5e9685bf4ee70781","observation_id":"a318e777-902e-41cd-a38b-63a683fa931b","resolution":{"observed_at":"2026-08-10T00:02:26.815819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-12T22:45:43.619281Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-10T00:02:26.229598Z","title":"STA-V2A : Video-to-audio generation with semantic and temporal alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.229598Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:2250d5d9a6e17e4c388f99d78df2831307d511363fecb791736c729cc2841a53","observation_id":"0173fc3d-43ff-461d-8c7a-f56bc89cdaf7","resolution":{"observed_at":"2026-08-10T00:02:26.229598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.793248Z","title":"W., Beerends, J","venue":null,"work_id":"b5ae45e6-fec1-48b8-a0c9-b1e1422b62bd","year":2001},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.233649Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:a939dcadd02e604c17f141292197b2725003c8ef1d0a7411bf25131ebb6ab8a4","observation_id":"76b4a802-6fbc-4208-b57d-19e5ffa2df38","resolution":{"observed_at":"2026-08-10T00:02:26.798275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.778400Z","title":"and Adi, Y","venue":null,"work_id":"dce778e2-b541-407b-83dc-16f950bae311","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.237491Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:56aad9d16b32d63e05d2dbd75ea6f037b6e69e9504a2a64bde8bad6f911fe022","observation_id":"b427e816-91cf-41df-910b-1708a806493d","resolution":{"observed_at":"2026-08-10T00:02:26.782611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-10T00:02:26.241116Z","title":"PandaGPT : One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.241116Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:cfb7bc082d7c4b634bc19215e3e139469f7f964ea5059c6e3b1df1ee4d6f0565","observation_id":"dcfaa58c-c1fb-4998-ab91-54afefd11800","resolution":{"observed_at":"2026-08-10T00:02:26.241116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.765257Z","title":"The influence of text-guidance on visual attention","venue":null,"work_id":"2ce1799e-bcba-4c4d-83b9-e27c9a6cd743","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.244867Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:1085b7980bb30b3b4e010a78fcdb59cd43b1c820e95ddcd5edd741c2e92a046e","observation_id":"7d449d2c-7c70-461c-89cd-588cb68bb726","resolution":{"observed_at":"2026-08-10T00:02:26.769698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.749632Z","title":"How is visual attention influenced by text guidance? database and model","venue":null,"work_id":"8cf42ae5-ffb7-4216-bb26-e1b0abb0d8ea","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.248517Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:d41aaf79fd6467619e6958185f8145ff1533a0f00fbce6e22288c8d0a8226b4b","observation_id":"120815b1-bc21-40e2-bfd9-36e100e1ba76","resolution":{"observed_at":"2026-08-10T00:02:26.754506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09748","last_updated":"2024-09-15T14:38:29Z","snapshot_observed_at":"2026-08-12T22:44:37.617237Z","submitted_at":"2024-09-15T14:38:29Z","title":"Explore the Hallucination on Low-level Perception for MLLMs","version":1},"cited_work":{"arxiv_id":"2409.09748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09748","snapshot_observed_at":"2026-08-10T00:02:26.446675Z","title":"Explore the Hallucination on Low-level Perception for MLLMs","venue":"cs.CV","work_id":"d09e4c15-6f32-4cb7-b495-c60eff831717","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.252376Z"},"links":{"cited_paper":"/paper/2409.09748","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:b41459d845ca4b6663c17000024a9c69b93d29a369acab613b4a52ed61797a54","observation_id":"8e2c7403-36c5-456d-8351-a3f6fc1535da","resolution":{"observed_at":"2026-08-10T00:02:26.450950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T00:02:26.256454Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.256454Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:cb2e2afd2ac7bb3f3d3228d2160a98e3d4f6a7572a61202ab5604c7ec2d205d8","observation_id":"acb85e0e-9cfe-4d1f-8f7e-428eaa8e3022","resolution":{"observed_at":"2026-08-10T00:02:26.256454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12387","last_updated":"2024-04-18T17:59:48Z","snapshot_observed_at":"2026-08-13T00:27:11.609683Z","submitted_at":"2024-04-18T17:59:48Z","title":"Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12387","snapshot_observed_at":"2026-08-10T00:02:26.260452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.260452Z"},"links":{"cited_paper":"/paper/2404.12387","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:ef60c0ac6d1049d88e36d83264bdb5bd7e085d6a75f3cf7b8a4aecc38630a98c","observation_id":"aa8832c5-e30d-471c-a17d-7504612c1fe3","resolution":{"observed_at":"2026-08-10T00:02:26.260452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.738016Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models","venue":null,"work_id":"ea395db2-c943-4c67-8d0e-42a5136910ce","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.264346Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:298806369c26a8135ce2071a8e34e62fdbd6949211fa352497a518988946c5d9","observation_id":"af93185d-f391-436d-bdd6-ecd0f6fea59f","resolution":{"observed_at":"2026-08-10T00:02:26.741748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07346","last_updated":"2025-02-02T08:58:09Z","snapshot_observed_at":"2026-08-13T08:58:04.647728Z","submitted_at":"2024-05-12T17:45:11Z","title":"Quality Assessment for AI Generated Images with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07346","snapshot_observed_at":"2026-08-10T00:02:26.267826Z","title":"Understanding and evaluating human preferences for ai generated images with instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.267826Z"},"links":{"cited_paper":"/paper/2405.07346","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:967165708b7514528b5b0b79342d6d972a4a8e45223c8c9a229aecf0419a1b59","observation_id":"a06682c8-17b6-480a-b6c1-0b2897661010","resolution":{"observed_at":"2026-08-10T00:02:26.267826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17221","last_updated":"2024-11-26T08:43:15Z","snapshot_observed_at":"2026-08-13T04:44:35.550453Z","submitted_at":"2024-11-26T08:43:15Z","title":"AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17221","snapshot_observed_at":"2026-08-10T00:02:26.271791Z","title":"AIGV-Assessor : Benchmarking and evaluating the perceptual quality of text-to-video generation with lmm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.271791Z"},"links":{"cited_paper":"/paper/2411.17221","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:6900ac8ec1088fcb11d20d2d6396d80242c7f3ff46001c80eb4cb7f3925d70a9","observation_id":"cebbe6fc-9da6-49a0-a4a0-2a4688c00092","resolution":{"observed_at":"2026-08-10T00:02:26.271791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.725566Z","title":"Tiva: Time-aligned video-to-audio generation","venue":null,"work_id":"daba42e9-abcd-4341-ac68-ecd956bbc58a","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.275625Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:794de484c92cd59bb6f711ab86b84522aea07f71d69343eca13aa16bf3ced42e","observation_id":"0a76a232-dce4-41ed-abc9-687eea36cec2","resolution":{"observed_at":"2026-08-10T00:02:26.729335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.710955Z","title":"A recipe for scaling up text-to-video generation with text-free videos","venue":null,"work_id":"d9f73b9b-3eea-4879-9534-b51b42d084e9","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.279119Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:7c6b354076084449ba2776278e1cbaff7e978b8ec6ca7c2f61d65268dd83df0f","observation_id":"2fb4dc11-4839-43de-bd19-a2a57c1a7e7a","resolution":{"observed_at":"2026-08-10T00:02:26.714931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.697504Z","title":"Modaverse: Efficiently transforming modalities with llms","venue":null,"work_id":"3a6bda59-0e98-4f52-878c-e331509c9b4c","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.282662Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:2639a1ee0594c15db09a99fe7afbeeeff0f0d858a8632528c244d26fddab66c6","observation_id":"018796f9-3fd2-43e6-b295-73f652f6c019","resolution":{"observed_at":"2026-08-10T00:02:26.703112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-13T10:04:30.993324Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-10T00:02:26.286357Z","title":"LAVIE : High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.286357Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:c1ac3ed22c4a2a6ce181209a5f6ace3571c966986f6b6eac48d14ee4d58d4679","observation_id":"4e73897b-2810-45a3-94e7-3160415148e0","resolution":{"observed_at":"2026-08-10T00:02:26.286357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-08-12T23:52:40.690851Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-10T00:02:26.290373Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.290373Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:d22a6ed26b0ac37c4f292e4046512993013d75837dc3347dedbc2a34e22de930","observation_id":"3a242a52-48b2-4cec-9a7b-8c4e1b088951","resolution":{"observed_at":"2026-08-10T00:02:26.290373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.684785Z","title":"Q-Align : Teaching LMMs for visual scoring via discrete text-defined levels","venue":null,"work_id":"8651dcc4-0c5b-4024-be45-c00abe39eee1","year":null},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.293796Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:c27e526755cedde61381933271ddcc9dd3d4b61ac6887fd80ed41fcee8728381","observation_id":"11e0a367-81ea-43cb-9175-79584784ff06","resolution":{"observed_at":"2026-08-10T00:02:26.689470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.670917Z","title":"NExT-GPT : Any-to-any multimodal llm","venue":null,"work_id":"d59b73b2-f2e3-4edc-ac42-b8e006b2d4d0","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.297158Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:a9a433cab858c73641467d4ac45e54c0da115c51e6deb653ff59e3e7dd6ad081","observation_id":"f2864ae5-a3c3-4d5d-806b-0b7be6a7b944","resolution":{"observed_at":"2026-08-10T00:02:26.675299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.656323Z","title":"Sonicvisionlm: Playing sound with vision language models","venue":null,"work_id":"d7bab440-e0c4-42e5-ab62-f6c3eeb4120a","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.300422Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:977dfc40dce69ef2141b3a94fc9f3818aa9ee3caa94de68ae402fe83e3d43228","observation_id":"50d2b6f4-94a9-42b8-a00c-386de598363e","resolution":{"observed_at":"2026-08-10T00:02:26.661344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09823","last_updated":"2024-09-15T18:51:18Z","snapshot_observed_at":"2026-08-12T22:44:32.885142Z","submitted_at":"2024-09-15T18:51:18Z","title":"Efficient Video to Audio Mapper with Visual Scene Detection","version":1},"cited_work":{"arxiv_id":"2409.09823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09823","snapshot_observed_at":"2026-08-10T00:02:26.365346Z","title":"Efficient Video to Audio Mapper with Visual Scene Detection","venue":"cs.SD","work_id":"3632ef4d-5881-49eb-a119-4d46871a03ef","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.303436Z"},"links":{"cited_paper":"/paper/2409.09823","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:50adc0bd0bb2472f4412ed7a9859345088e29bc900ddb308781c281efb1d9719","observation_id":"910fe5ed-f1b0-48c2-8584-ca20a38da188","resolution":{"observed_at":"2026-08-10T00:02:26.371834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.640418Z","title":"Telepresence video quality assessment","venue":null,"work_id":"f73ff1ab-838a-43cc-9ea2-991f4dd84efa","year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.306497Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:16bb7b94ab8c30208c65cb714f08ae4ecb4b2c4c37b14605b9378d18c42e5f78","observation_id":"795ccb3c-3b8b-435e-840b-12bb25dca64c","resolution":{"observed_at":"2026-08-10T00:02:26.644619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.628568Z","title":"E., Fu, S.-W., Fuh, C.-S., Tsao, Y., and Wang, H.-M","venue":null,"work_id":"bb708781-5402-4629-b0a6-1e3d76343064","year":2020},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.309233Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:adff6eae8dedd01500f389e46fed16d0ea20e9d575668434c5aecca5b04c26cc","observation_id":"22a6b40c-e1a5-4ea8-8e30-a5d03663809d","resolution":{"observed_at":"2026-08-10T00:02:26.632511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-12T23:31:04.494652Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-10T00:02:26.312439Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.312439Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:f07fc7c3c29edecd893b6d63494a8091d2cc37e66b3273f6dd822f22c67c73cd","observation_id":"24cb6520-edae-4e6e-ab85-24c89b42df46","resolution":{"observed_at":"2026-08-10T00:02:26.312439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.616371Z","title":"Lmm-pcqa: Assisting point cloud quality assessment with lmm","venue":null,"work_id":"03667d2f-d29d-4582-979d-fb5fa4c89f17","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.316126Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:3c486b4992a52c51ceb3e198db3c2929255168787c4606b582fc4e26cd650056","observation_id":"0e247d60-34a4-48fc-93ba-a0493d534c6d","resolution":{"observed_at":"2026-08-10T00:02:26.620940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.319596Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.319596Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:033cb48af5e6169fee8b1b2f118a5ef408f5b54d4f7fa84f3ac01ca8be4c77be","observation_id":"07557746-ac0d-4d5e-b0b6-243fc6bfc735","resolution":{"observed_at":"2026-08-10T00:02:26.319596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-13T10:33:57.498212Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":43},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 2 inbound Pith citation observations for arXiv:2501.18314."}