{"as_of":"2026-08-12T13:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6da16b25c575c10619e52166e80baee77babff3db66c0d3584fa866038623771","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:12.567839Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:12:38.454127Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T17:42:26.143560Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-07-13T23:27:58.971096Z","title":"OmniEval: A benchmark for evaluating omni-modal models with visual, auditory, and textual inputs.arXiv preprint arXiv:2506.20960, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16859","last_updated":"2026-07-01T09:16:52Z","snapshot_observed_at":"2026-08-12T04:19:08.766570Z","submitted_at":"2026-03-17T17:58:44Z","title":"SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-13T23:27:58.971096Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2603.16859"},"observation_digest":"sha256:9a954ad47122bd45a9dd3a97f68c407e376a37f40b5d809ab61b11069605758d","observation_id":"2730f9b8-4354-44bb-b738-6016ba2b65de","resolution":{"observed_at":"2026-07-13T23:27:58.971096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":"2506.20960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-06-28T17:42:26.143560Z","title":"Omnieval: A benchmark for evaluating omni-modal models with visual, auditory, and textual inputs","venue":null,"work_id":"1e6d7b36-f4ce-4ab1-a702-dd78efd24a0e","year":2025},"citing_paper":{"arxiv_id":"2605.07593","last_updated":"2026-05-08T11:06:43Z","snapshot_observed_at":"2026-07-06T23:19:56.415523Z","submitted_at":"2026-05-08T11:06:43Z","title":"TraceAV-Bench: Benchmarking Multi-Hop Trajectory Reasoning over Long Audio-Visual Videos","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-11T01:53:01.939765Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2605.07593"},"observation_digest":"sha256:772b8fbe4d8aed9caddd857e7a9e92d3a0cd83f99855592d5109a65355784284","observation_id":"db3424f7-a96b-489d-bee4-18522e05b557","resolution":{"observed_at":"2026-05-11T04:15:56.078287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":"2506.20960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-06-28T17:42:26.143560Z","title":"Omnieval: A benchmark for evaluating omni-modal models with visual, auditory, and textual inputs","venue":null,"work_id":"1e6d7b36-f4ce-4ab1-a702-dd78efd24a0e","year":2025},"citing_paper":{"arxiv_id":"2606.00959","last_updated":"2026-08-08T13:46:52Z","snapshot_observed_at":"2026-08-12T12:18:59.660429Z","submitted_at":"2026-05-31T02:29:36Z","title":"Towards Understanding Modality Interaction in Multimodal Language Models via Partial Information Decomposition","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T17:40:30.038337Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2606.00959"},"observation_digest":"sha256:15afdd546cd29fb64818238cec4e376aadac5114d7cb4711aa4d021996b796af","observation_id":"c5e4067b-2c44-4678-a1c2-06322a667f58","resolution":{"observed_at":"2026-06-28T17:42:26.145281Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20960","snapshot_observed_at":"2026-08-02T03:12:38.454127Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:38.454127Z"},"links":{"cited_paper":"/paper/2506.20960","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:a9d6d41f2631bf7006e18fcfa4d55a5497f50202b209b723f604c5a6b671e226","observation_id":"cb12b0a5-33cd-4e82-98f0-de806c00ccc2","resolution":{"observed_at":"2026-08-02T03:12:38.454127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20960/citation-record","integrity":"/paper/2506.20960/integrity","json":"/paper/2506.20960/citation-record.json","paper":"/paper/2506.20960"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.734883Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.734883Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:e21248013f1f63ac7cf899a77b1879ca4c442afd4a62de459af3fa411b9cc78b","observation_id":"f225cebc-1161-439d-8716-a5d59df990eb","resolution":{"observed_at":"2026-08-06T22:41:06.734883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:16.473154Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"70ae398a-3099-491b-8167-a932dfc6512c","year":2015},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.815550Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:6c34d808fe763d7ca3ef75c23990bb915ca003b99710914690e0aa7dc6d680b8","observation_id":"5e2366f1-1b8a-42b4-9d74-84e83b6181e8","resolution":{"observed_at":"2026-08-06T22:41:16.535302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:16.303675Z","title":"From pre-training to fine-tuning: An in-depth analysis of large language models in the biomedical domain","venue":null,"work_id":"afc519fd-c7d0-4c02-bcce-21076e6c9ebc","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.894106Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:9bcaaea9d6cddccdf41ad5abf05cd9189e7ce31699ba2416cff1b9979259bd02","observation_id":"1d587128-15c0-4c15-810d-3476be033fec","resolution":{"observed_at":"2026-08-06T22:41:16.366029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.985286Z","title":"Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.985286Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:026c023ad9115174b2e9701f38e2b419f6b010d9868d63894c2c93c017a2aca9","observation_id":"cd096af0-f108-46e6-9c71-25011fc1ec36","resolution":{"observed_at":"2026-08-06T22:41:06.985286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-08-11T18:40:40.874064Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-06T22:41:07.070388Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.070388Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:32d1c8be4fa10d8398d69fe5684019a7c0fb84b0b3d0020509d78b35d999a234","observation_id":"f0c1fecd-0d5e-46e2-96fd-1bf79aa69b5e","resolution":{"observed_at":"2026-08-06T22:41:07.070388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-09T08:32:43.969496Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-06T22:41:07.185729Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.185729Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:c12ea529905c3a4d75333d2c6f8ea378175f48c859effe6eee3ca147e668d93a","observation_id":"beb48705-2f65-4847-94ff-a778753b0bd1","resolution":{"observed_at":"2026-08-06T22:41:07.185729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08379","last_updated":"2018-05-30T09:15:57Z","snapshot_observed_at":"2026-08-10T09:40:40.823973Z","submitted_at":"2018-02-23T04:06:38Z","title":"EmotionLines: An Emotion Corpus of Multi-Party Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08379","snapshot_observed_at":"2026-08-06T22:41:07.259689Z","title":"Emotionlines: An emotion corpus of multi-party conversations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.259689Z"},"links":{"cited_paper":"/paper/1802.08379","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:95c0e57f944258233c5f6b8254589b99a24c0bb8eb91320550a5033b5245291c","observation_id":"98545770-40e3-4b0b-bc3c-91bc9998f5e0","resolution":{"observed_at":"2026-08-06T22:41:07.259689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:41:07.346165Z","title":"VideoLLaMA 2: Advanc- ing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.346165Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:36980490efea3f97689e91588953394742db804886789f33c8d0df23c6df530c","observation_id":"b275f25c-94bb-4ada-ab5e-4bd3a85d5e37","resolution":{"observed_at":"2026-08-06T22:41:07.346165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T22:41:07.424327Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.424327Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:75f484e68f1b381b90cb43124131e07cecc67f555a4b185b793a0dfb95fd2323","observation_id":"a666ecfd-3861-4c73-84bc-c7c195e80402","resolution":{"observed_at":"2026-08-06T22:41:07.424327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T22:41:07.513119Z","title":"Training Verifiers to Solve Math Word Problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.513119Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:5bf77e743b07a3c8bcf42268bc17c55e803481a48215f831d99eee78dd2e6c35","observation_id":"d1b67d40-cf4b-446a-8d72-87c15ab0214b","resolution":{"observed_at":"2026-08-06T22:41:07.513119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:16.133211Z","title":"Fleurs: Few-shot learning evaluation of universal representations of speech, 2022","venue":null,"work_id":"862a7f91-c62c-4b5c-862c-160095301559","year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.564476Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:ba7de3311702f7a3d88f6c8a8b70f46e7d63570009a8bed83dbd85fc8d2910e0","observation_id":"683b0b58-bb8b-431d-a76c-cfc12a45be5f","resolution":{"observed_at":"2026-08-06T22:41:16.225901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.676280Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.676280Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:9bbeecc387315d87a89249e63269d0030d7e783e94ab566259ef36e233f0b336","observation_id":"4ab4286a-3fb9-438e-aa33-a05606cd76c0","resolution":{"observed_at":"2026-08-06T22:41:07.676280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.982568Z","title":"Finevideo","venue":null,"work_id":"92093145-585d-477a-bdc3-751ae5d0aa97","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.761731Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:ca82d0ea4c4fe380559a5657d47a33995627a531eb0e734310977f9eff02043d","observation_id":"3a5efb7c-427e-43b3-8172-acffd2c5344a","resolution":{"observed_at":"2026-08-06T22:41:16.029585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T22:41:07.861174Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.861174Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f8f86209f2a7891add4b5b6252f0d17619f88993716bd1cc584acff4335f7bce","observation_id":"f7ebc80b-8bb9-418e-8453-3897aa102aad","resolution":{"observed_at":"2026-08-06T22:41:07.861174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T22:41:07.943880Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.943880Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:264bddafd42b15514a11f5e8547fd56bb2dd4c2654aea792377164e25a5c9d6f","observation_id":"92ec66cc-80e7-40c1-ab3b-b1c9d3761695","resolution":{"observed_at":"2026-08-06T22:41:07.943880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19772","last_updated":"2025-03-20T11:55:30Z","snapshot_observed_at":"2026-08-12T05:47:41.871700Z","submitted_at":"2024-11-29T15:18:06Z","title":"LongVALE: Vision-Audio-Language-Event Benchmark Towards Time-Aware Omni-Modal Perception of Long Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19772","snapshot_observed_at":"2026-08-06T22:41:08.047046Z","title":"Longvale: Vision-audio-language-event benchmark towards time-aware omni-modal perception of long videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.047046Z"},"links":{"cited_paper":"/paper/2411.19772","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:3b42b4d0826d0a37b82b9a62cfd0468be66c75717ba279a9e1ddb0afefd5bda3","observation_id":"7fdc8698-1508-428c-81bc-49d4698ad336","resolution":{"observed_at":"2026-08-06T22:41:08.047046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.830151Z","title":"Gemini 2.5: Our most intelligent ai model, 2025","venue":null,"work_id":"c3c08712-82a6-48b5-9ee2-e884cd307087","year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.151171Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:d920a95d23330194e7fbb1d7663c309a68145681b8f1ea09c3c5a44b3255a68c","observation_id":"a23a837b-7bfe-465a-8445-9b69c65e6321","resolution":{"observed_at":"2026-08-06T22:41:15.895029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.251757Z","title":"Making the V in VQA matter: Elevating the role of image understanding in Visual Question Answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.251757Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:52ee1c7964844c657d4ee91f4a215d8d25d7a306aba95865e2e460fa88652b8e","observation_id":"c1095ca1-58ba-4ecf-b3c5-920ab8acce7a","resolution":{"observed_at":"2026-08-06T22:41:08.251757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08218","last_updated":"2018-05-09T17:26:40Z","snapshot_observed_at":"2026-08-10T08:46:04.120079Z","submitted_at":"2018-02-22T18:16:53Z","title":"VizWiz Grand Challenge: Answering Visual Questions from Blind People","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08218","snapshot_observed_at":"2026-08-06T22:41:08.363669Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.363669Z"},"links":{"cited_paper":"/paper/1802.08218","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:eb2067d58fa59a6e2c89ea5e041c83547c35be8b5947cbf9443f3d1fe4781cf7","observation_id":"4a4c75c9-2cc5-478f-98a8-8d6243394041","resolution":{"observed_at":"2026-08-06T22:41:08.363669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T22:41:08.456014Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.456014Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:4b9c9fd7a003c0a0b5b965d193073313b35505bf84debf72e86f420bcaf37e1a","observation_id":"caf43fd7-4a25-488e-aff0-47b4d871774b","resolution":{"observed_at":"2026-08-06T22:41:08.456014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.610573Z","title":"TED-LIUM 3: Twice as Much Data and Corpus Repartition for Experiments on Speaker Adaptation, page 198–208","venue":null,"work_id":"b9cc3fe5-84bb-42ea-a98f-90f9fa43cb10","year":2018},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.535756Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:681042c48b22d9b2c434d2813acffcfaa3f0a1932077fdd915c4065e31baf528","observation_id":"24130295-32dc-4437-8bd4-1a9d53dd9372","resolution":{"observed_at":"2026-08-06T22:41:15.690697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.604727Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.604727Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:6a42ac1ad63a59d407009e29d0acaeee2b142e1bfed9912e15cd83712b5496b0","observation_id":"a45e1a72-0485-486f-a6ef-fbca14729fec","resolution":{"observed_at":"2026-08-06T22:41:08.604727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-06T22:41:08.706606Z","title":"Worldsense: Evaluat- ing real-world omnimodal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.706606Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:de0011ecb52d435cb2e1f6b45c8d744d5ec570aa7dc988816d2c362011ae5961","observation_id":"86971764-831a-49ba-b2e2-67cb9fdfa03c","resolution":{"observed_at":"2026-08-06T22:41:08.706606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.818096Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.818096Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:cfcb9f45525f56cf4ab4c6c8edbd409e2018b7016545bbc3dfce844a62ef1f3a","observation_id":"1067f61e-484e-4a6e-acb5-5e50ea6be5fc","resolution":{"observed_at":"2026-08-06T22:41:08.818096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.493656Z","title":null,"venue":null,"work_id":"3066da81-109b-4c34-b27d-e1eecd791be9","year":2014},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.896095Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:e928ef2a82ff857ca57b321b8166841b6a970c72120be5a53f171529fb25303c","observation_id":"91af4e98-0bde-44e4-9fb7-3cec99c1f56d","resolution":{"observed_at":"2026-08-06T22:41:15.536276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.343882Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"a16175c6-cbc7-46b8-bb06-1f576fd42354","year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.002699Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:1b61079964b71d08acb05033deb0bdaac65babe0eda18e695d470022556fcb41","observation_id":"7a62604c-a5a0-4205-8515-e12c0ed20d7c","resolution":{"observed_at":"2026-08-06T22:41:15.399615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:09.124008Z","title":"Baichuan-omni-1.5 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.124008Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:bd52ee91db9f39ace1382acd24fab1a90098e83a7a020d07ade588e3e65f3266","observation_id":"36e74076-1271-4dd2-98aa-4daa1a72c325","resolution":{"observed_at":"2026-08-06T22:41:09.124008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.186079Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"3b7b4f30-b165-4a6f-8232-db0adf2068d6","year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.236197Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:1f069fa29bf344a3d9c62477fa60f399dc0e7f3879e89b609c2653f0056f6bff","observation_id":"3b5ba30b-c55a-4e90-8ea9-5408d8b54426","resolution":{"observed_at":"2026-08-06T22:41:15.251245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:09.320715Z","title":"Omnibench: Towards the future of universal omni-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.320715Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:3c6529d451e3f62c22983dcd46aef3eefcc9158db79242431865661486f3f5d7","observation_id":"cdc5fcfe-06de-4bef-99d7-b1027923e643","resolution":{"observed_at":"2026-08-06T22:41:09.320715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:09.397134Z","title":"Omnibench: Towards the future of universal omni-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.397134Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:6f4d47abe8f07977133bd0ce83fe28e5030597c0527443e48d402aa07841543c","observation_id":"de84453d-89d0-429f-be37-bec0b7aab529","resolution":{"observed_at":"2026-08-06T22:41:09.397134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-07-06T19:45:57.808548Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-06T22:41:09.479989Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.479989Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:a365eef673e130c206d7817cf2a1e179f97fc2ecb5140d85675793082c49cab9","observation_id":"06bc4f0d-0227-4fc5-9358-d442d0b8ea74","resolution":{"observed_at":"2026-08-06T22:41:09.479989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:15.031450Z","title":"Clotho-aqa: A crowdsourced dataset for audio question answering, 2022","venue":null,"work_id":"830bd8e9-21c0-4541-8724-0bbfec194928","year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.570093Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:caf93f64295d0be10312c885779a5fc1aa2068e6c5d08121a5e6b3fb6f50fafa","observation_id":"885f63c8-9367-4978-9fb4-894fe5dcf70f","resolution":{"observed_at":"2026-08-06T22:41:15.107148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T22:41:09.665514Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.665514Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:db3e885413a30ac3911ea762bbb64c53f2cb4321c1dbd2f385f6647dea0886ae","observation_id":"e6be41f8-518f-4f04-ab54-ebb24811f76f","resolution":{"observed_at":"2026-08-06T22:41:09.665514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-06T22:41:09.774966Z","title":"MMBench: Is Your Multi-modal Model an All-around Player? arXiv preprint arXiv:2307.06281, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.774966Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:801ae0238f471d64c5fad4cf8c290b694d2d5675a74238641fed60ba5701880c","observation_id":"bb6f2337-76e9-4cfa-a6fc-2fc12be03d4a","resolution":{"observed_at":"2026-08-06T22:41:09.774966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T22:41:09.864310Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.864310Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:73b335c1b32a68be4b8b75be2790a7129849a62228e4130a535732d2947a23a0","observation_id":"c640d218-a471-4267-a56e-a0243a26a596","resolution":{"observed_at":"2026-08-06T22:41:09.864310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.867990Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"dab73067-48ce-45cf-b920-a4b2589eae0f","year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.951816Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:9ac6fa053cb9bbf05e0b11de6a74ec29fdf10ee8f3bad66c5914624356ea98f6","observation_id":"8b404fbb-252f-44f4-b006-15416d8bec1b","resolution":{"observed_at":"2026-08-06T22:41:14.948481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.685138Z","title":"Spoken question answering and speech continuation using spectrogram-powered LLM","venue":null,"work_id":"9f87d5d9-5fd7-4209-be08-84935e26ce29","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.082574Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:e5b52b1e275b42390b97e2f8c507db1572edd4ad7ac091ac03aea3d83d3c6ce4","observation_id":"57c96686-2be7-4790-88ff-73314df941a9","resolution":{"observed_at":"2026-08-06T22:41:14.746493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-08T04:51:01.052037Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-06T22:41:10.216134Z","title":"V oxceleb: a large-scale speaker identification dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.216134Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:ade81f36539f5477bd68f41a733e0a5539d715438a4ea22556b4126ab8d597f9","observation_id":"633ee0bf-d760-4d6b-be59-1f7fdf72682b","resolution":{"observed_at":"2026-08-06T22:41:10.216134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.494288Z","title":"Minicpm-o 2.6: A gpt-4o-level mllm for vision, speech, and multi- modal live streaming on your phone","venue":null,"work_id":"56aad69b-fb96-4d00-8408-08138d7ed383","year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.316996Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f3497b18e401e1ff5d2368b517762ef33d2d70b974d9cb074681a303ac50b812","observation_id":"70251e21-663e-4876-8a5a-e6596219200f","resolution":{"observed_at":"2026-08-06T22:41:14.604431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.336731Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":"9918059b-c1ad-40e8-81d5-588effaa5781","year":2015},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.447338Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:ee3ee2a36f7b7d919d8f17968ba2c56b6c9c85a2e204968dde5256d853b72df5","observation_id":"01e21f72-be9b-4566-8e57-04744ff39443","resolution":{"observed_at":"2026-08-06T22:41:14.410005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.195276Z","title":"Plummer, Liwei Wang, Christopher M","venue":null,"work_id":"b8eb9116-492a-4071-bdf5-2daa1a3b40f8","year":2017},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.542832Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:963810e1713ffee17d1984cd735c1fdd35e023a08aaa71450e3e12a0bdf41042","observation_id":"88e76809-59f1-413b-accd-badad0c908f7","resolution":{"observed_at":"2026-08-06T22:41:14.264172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:14.049711Z","title":"MELD: A multimodal multi-party dataset for emotion recognition in conversation","venue":null,"work_id":"3badf041-f8c9-4257-acf7-495e6eab63fb","year":2019},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.673146Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:524b4c39a6433d9d7fc0972de86b04ebce8bb71944fe0dd8af687f5cf648f54e","observation_id":"f400eb72-c47b-4d0c-a95c-99896722aad0","resolution":{"observed_at":"2026-08-06T22:41:14.121328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04388","last_updated":"2025-05-16T08:24:31Z","snapshot_observed_at":"2026-08-10T10:56:10.116728Z","submitted_at":"2024-09-06T16:27:52Z","title":"Question-Answering Dense Video Events","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04388","snapshot_observed_at":"2026-08-06T22:41:10.769779Z","title":"Question-answering dense video events","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.769779Z"},"links":{"cited_paper":"/paper/2409.04388","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:74f432ad1184671c3cd096285e0436f59effafec7b29c9495f9b5ba0faf1f91e","observation_id":"572dbd7c-2733-4873-b333-0f651e326e04","resolution":{"observed_at":"2026-08-06T22:41:10.769779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:10.938665Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.938665Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:119c2578e4d26d60bb44c3910bab2af09cae14411203f737f27400b29ca1d369","observation_id":"59b980dd-af92-4650-873a-384245114850","resolution":{"observed_at":"2026-08-06T22:41:10.938665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-06T22:41:11.063492Z","title":"Towards VQA Models That Can Read.arXiv preprint arXiv:1904.08920, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.063492Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:a1f0c283fab9dd52c061a2c0cb7b6c492660777ecbe339bcfe2853abf49c23f3","observation_id":"48d88fd4-04d5-4c15-8189-57fc55a9ba9d","resolution":{"observed_at":"2026-08-06T22:41:11.063492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14283","last_updated":"2025-05-20T12:32:47Z","snapshot_observed_at":"2026-08-07T15:35:01.512171Z","submitted_at":"2025-05-20T12:32:47Z","title":"A precise detection method for transient micro short-circuit faults of lithium-ion batteries through signal processing","version":1},"cited_work":{"arxiv_id":"2505.14283","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14283","snapshot_observed_at":"2026-08-06T22:41:12.864756Z","title":"A precise detection method for transient micro short-circuit faults of lithium-ion batteries through signal processing","venue":"eess.SP","work_id":"fa8ed028-202f-4ef7-894e-e2cde346c42d","year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.176834Z"},"links":{"cited_paper":"/paper/2505.14283","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:c5e9583f1c2067a02ca83fce5808bf6d7e7016212223a1942278aacf525e55ae","observation_id":"b9b2e1ea-2cde-4190-aaaa-c0fc00120c60","resolution":{"observed_at":"2026-08-06T22:41:12.954686Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T22:41:11.279409Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.279409Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:c013d75adc3176974f8d6e489de8401a84c3b74dbb5d5c3cb8bb5416e440a9d7","observation_id":"a9893c17-2fa5-4e67-ae51-9b576e6ccc2c","resolution":{"observed_at":"2026-08-06T22:41:11.279409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:41:11.369391Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.369391Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:ad3e275315a66ab038bc7fe1e7c36e5d57a5ea895f400a6d4b6782f58bcc29ec","observation_id":"7f235de8-3e1a-48f2-994d-218f17a1f298","resolution":{"observed_at":"2026-08-06T22:41:11.369391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T22:41:11.475765Z","title":"Qwen2.5: Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.475765Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:1382436a00c2bb6a38beae652679ec49a247e556692e3caa836f028ac38c78e8","observation_id":"b785eea0-6ead-4bd2-9624-86372ae71d2a","resolution":{"observed_at":"2026-08-06T22:41:11.475765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T22:41:11.561442Z","title":"CogVLM: Visual Expert for Pretrained Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.561442Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:6afa719380f212e785927a6438199025aaa85cfa2ecd8937d3e343c21bcc5573","observation_id":"c07cb19b-8a30-4d36-a3b7-d64e99640254","resolution":{"observed_at":"2026-08-06T22:41:11.561442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T22:41:11.644932Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.644932Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:1ae146f08578afa98e2d000b67ea986b4e1095df890599f0914982628ce9105b","observation_id":"90f6c13b-1feb-4c9b-9e49-f33c3b804798","resolution":{"observed_at":"2026-08-06T22:41:11.644932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04362","last_updated":"2023-06-07T11:52:36Z","snapshot_observed_at":"2026-08-10T06:44:23.913507Z","submitted_at":"2023-06-07T11:52:36Z","title":"Youku-mPLUG: A 10 Million Large-scale Chinese Video-Language Dataset for Pre-training and Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04362","snapshot_observed_at":"2026-08-06T22:41:11.661900Z","title":"Youku-mplug: A 10 million large-scale chinese video-language dataset for pre-training and benchmarks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.661900Z"},"links":{"cited_paper":"/paper/2306.04362","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:18f97f5bc8f5f71a23c6c976f58edd52abd63d888429791b4f80876dd02648ef","observation_id":"50918665-cf97-4c2f-9f92-a8529f81cb66","resolution":{"observed_at":"2026-08-06T22:41:11.661900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T22:41:11.841114Z","title":"Qwen2.5-Omni Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.841114Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:f749c1b5776ab60b8892a3cc38d0754628ed2d9e0cd4a61785fb42975e048939","observation_id":"40f2cc99-5c71-49af-843d-2f38b6f1c043","resolution":{"observed_at":"2026-08-06T22:41:11.841114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:11.967533Z","title":"Air-bench: Benchmarking large audio-language models via generative comprehension, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.967533Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:32ee9ca0219ed743375087a7d1ed48bc7487b18edd052a21821958493449587d","observation_id":"01de9829-d349-4f13-972c-fb4f35bb5ecf","resolution":{"observed_at":"2026-08-06T22:41:11.967533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:12.118730Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions.TACL, 2:67–78, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.118730Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:451b5e1386fbb1e0d33265166133dfeb81db67ca077abd04730066c47621f254","observation_id":"2b3e6c2e-49c4-4f9b-8419-3f622fc5d2e1","resolution":{"observed_at":"2026-08-06T22:41:12.118730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:13.880467Z","title":"Berg, and Yuandong Tian","venue":null,"work_id":"2f2611dd-128a-43cf-92ee-8fc66e050c5c","year":2016},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.231890Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:cd0494b899d77b32ca8ce5b0b0968991a09c72dc48010fdff09e0359f2d194c7","observation_id":"d0bd4c52-9490-47df-89e2-74c141147d0c","resolution":{"observed_at":"2026-08-06T22:41:13.941233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-06T22:41:12.314340Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.314340Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:af2e6a84d40eb4063b34bdc3872954e4541ccb4c225fa0a326e828b0da07f869","observation_id":"6222991a-cc70-4303-8a1e-e0bbd2d9d79c","resolution":{"observed_at":"2026-08-06T22:41:12.314340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:12.402858Z","title":"Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.402858Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:2f4af92bc8ffcef35443997746cabfdecc315bb7653e4e7186aabd7b3cd92747","observation_id":"f47c004c-2c97-4e69-bf3a-a2ee632fd0f3","resolution":{"observed_at":"2026-08-06T22:41:12.402858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:13.735070Z","title":"Zhang and M","venue":null,"work_id":"8107757b-515a-4de2-9bb5-22722b404cb9","year":2024},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.455460Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:1e120f2a7f0035ae1c49ae0459cff3108d0f76b5dae7af5c1b15daa3826b4c64","observation_id":"21460dda-f689-4f1d-940c-7ec25356ea79","resolution":{"observed_at":"2026-08-06T22:41:13.810971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:13.596858Z","title":"Yin and Yang: Balancing and answering binary visual questions","venue":null,"work_id":"f1983a92-12df-40b7-a43c-ba1ef6d998ff","year":2016},"citing_paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.567839Z"},"links":{"citing_paper":"/paper/2506.20960"},"observation_digest":"sha256:4ca606278a6d9a3f228454ae4cc1b896971c88d21dcf254534f74130ed79796e","observation_id":"524268b1-1fcb-4478-a98d-3003119ad138","resolution":{"observed_at":"2026-08-06T22:41:13.679803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20960","last_updated":"2025-06-29T15:16:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T21:54:32.026742Z","submitted_at":"2025-06-26T02:54:24Z","title":"OmniEval: A Benchmark for Evaluating Omni-modal Models with Visual, Auditory, and Textual Inputs"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 4 inbound Pith citation observations for arXiv:2506.20960."}