{"as_of":"2026-08-12T19:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d24905411cc1ea517e8884a8342bd6ac3a4954394dfa8de3e13b9f129b16c5ec","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:36:16.371915Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":24,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:13:44.385618Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:20:06.286106Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2511.14582","last_updated":"2026-04-20T05:56:36Z","snapshot_observed_at":"2026-08-11T07:38:35.887358Z","submitted_at":"2025-11-18T15:22:32Z","title":"OmniZip: Audio-Guided Dynamic Token Compression for Fast Omnimodal Large Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-17T20:45:37.418493Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2511.14582"},"observation_digest":"sha256:1181f6a9569afa8152170e5c1daad3b536f8c4ff4297db97f856463c766bb4d3","observation_id":"5254e4da-853c-4ac8-8643-6b2e024fa21e","resolution":{"observed_at":"2026-05-17T20:50:15.048217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-03T17:16:42.542703Z","title":"Humanomniv2: From understanding to omni- modal reasoning with context.arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:42.542703Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:ebc0b8d9c42dcac30eff7dcee0528ffd02af4aca14fe9892f070a1712a74d77e","observation_id":"c9b2aa38-e488-4e17-83a9-43891b92c31f","resolution":{"observed_at":"2026-08-03T17:16:42.542703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-03T03:15:11.377213Z","title":"timestamp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.08711","last_updated":"2026-07-02T10:23:24Z","snapshot_observed_at":"2026-08-08T12:42:58.671472Z","submitted_at":"2026-02-09T14:21:58Z","title":"TimeChat-Captioner: Scripting Multi-Scene Videos with Time-Aware and Structural Audio-Visual Captions","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T03:15:11.377213Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2602.08711"},"observation_digest":"sha256:61a877af242a2a144b585505a9a64c680b7f335bd99617d349d59ac265604514","observation_id":"95218483-f9a3-4ebb-b2e0-62ea836414ee","resolution":{"observed_at":"2026-08-03T03:15:11.377213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.08209","last_updated":"2026-04-09T13:09:40Z","snapshot_observed_at":"2026-08-11T13:16:43.284900Z","submitted_at":"2026-04-09T13:09:40Z","title":"OmniJigsaw: Enhancing Omni-Modal Reasoning via Modality-Orchestrated Reordering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T17:45:51.528645Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.08209"},"observation_digest":"sha256:c6c16e292279f60ee9ab8fcf81b5f3165e5a97c0b78667e0388aca654471ac53","observation_id":"48f64fe9-9131-45e2-8b4d-3a57bd8dfc5c","resolution":{"observed_at":"2026-05-11T06:11:01.853846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:8f96dc568907e0010babd901edecd3275d3c2c3be1bc39a133991aa8b6f0f905","observation_id":"ad84e811-f1ba-43c7-ba5f-a6cfadc8f22f","resolution":{"observed_at":"2026-05-11T11:11:03.635645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-08-11T15:24:09.432999Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:a6cb51a4aa2f6c2f891048f7b20b78b2a074811fefff7e021d7c951fb3797dfa","observation_id":"2d070b2f-fe4b-43aa-8871-d9c741d48a2e","resolution":{"observed_at":"2026-05-10T12:10:22.096457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:36c9dba74a424b16a539991ac630b2a7450e1eb0d2858c1407e4d50b30e8681d","observation_id":"9c31247b-557b-4232-b4a8-1d464eac4536","resolution":{"observed_at":"2026-05-10T09:18:32.195070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.09996","last_updated":"2026-05-11T05:11:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T05:11:22Z","title":"Omni-Persona: Systematic Benchmarking and Improving Omnimodal Personalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:01:23.060562Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.09996"},"observation_digest":"sha256:0705c00e2bd125f167c575a2e0afe52056cb2e1187c2dba64059ebc122f2db0a","observation_id":"f0ea401e-48d2-42cb-97e1-5bb6bd5864e1","resolution":{"observed_at":"2026-05-12T06:46:24.087743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T03:49:58.240883Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:a06f0de5b6b71b52501019ea2e58ca800c090d86c34585a653e68afb3c015df2","observation_id":"6fec6123-dd93-45a8-be08-fed71f6a3750","resolution":{"observed_at":"2026-05-13T03:52:12.705531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T06:06:20.658030Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:34257f4678657559c26c79b386f84555144eeff07835e730773b9f0a82190301","observation_id":"5e34008f-04ec-4570-9bde-2018ab456caa","resolution":{"observed_at":"2026-05-15T06:09:50.263174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.12056","last_updated":"2026-05-12T12:42:44Z","snapshot_observed_at":"2026-08-10T23:43:10.234096Z","submitted_at":"2026-05-12T12:42:44Z","title":"OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-13T04:52:03.076788Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.12056"},"observation_digest":"sha256:65b18b9f4b982d7b9ac5606da3dc70b74c45ad763a8e89e90bd8f577b6474776","observation_id":"f2b4c485-182d-433f-a46b-7206a4820b9c","resolution":{"observed_at":"2026-05-13T04:52:16.258450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.18018","last_updated":"2026-05-18T08:09:37Z","snapshot_observed_at":"2026-07-06T23:28:55.079333Z","submitted_at":"2026-05-18T08:09:37Z","title":"See What I Mean: Aligning Vision and Language Representations for Video Fine-grained Object Understanding","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-20T12:10:54.874012Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.18018"},"observation_digest":"sha256:dcbc06a387ec0591fd85af774931a31a344349643d12be676a2c434e78c8c151","observation_id":"f4bb1498-5f94-4c4e-9d23-241b5b30ffcb","resolution":{"observed_at":"2026-05-20T12:13:16.164422Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2605.22012","last_updated":"2026-05-21T05:18:57Z","snapshot_observed_at":"2026-08-05T07:24:30.530987Z","submitted_at":"2026-05-21T05:18:57Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-22T06:34:57.483234Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2605.22012"},"observation_digest":"sha256:15dd259e26418cb0e6517be89ee9bda500b7a58e92d0528ecc2ca876dfa225bc","observation_id":"98d9eaa6-52e2-4e35-ae19-f7b6495b6242","resolution":{"observed_at":"2026-05-22T06:36:10.573414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.12018","last_updated":"2026-06-10T12:44:02Z","snapshot_observed_at":"2026-08-03T20:21:32.396120Z","submitted_at":"2026-06-10T12:44:02Z","title":"MODF-SIR: A Multi-agent Omni-modal Distilled Framework for Social Intelligence Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T09:43:56.299302Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.12018"},"observation_digest":"sha256:c198b8dabb63b28e399a19815903eea8aafe25c9e51c318dfb9c9f8f10c875a4","observation_id":"b44a9268-54eb-4b16-9f84-0587a19943c4","resolution":{"observed_at":"2026-07-03T10:58:03.460392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.20970","last_updated":"2026-06-18T22:17:18Z","snapshot_observed_at":"2026-08-01T20:10:55.070907Z","submitted_at":"2026-06-18T22:17:18Z","title":"CogniRoute: Learning to Route Social Evidence in Omni-Modal Models","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-06-26T17:37:11.371892Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.20970"},"observation_digest":"sha256:5f8a2f9d4acce2c35387f8a50adfaf417d4759b635bdc71ee994d0171f986fed","observation_id":"db542710-299f-4a10-8c70-18144ce331a2","resolution":{"observed_at":"2026-07-04T03:49:30.332893Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.25325","last_updated":"2026-07-20T13:20:39Z","snapshot_observed_at":"2026-08-02T10:17:41.360200Z","submitted_at":"2026-06-24T02:43:26Z","title":"Omni-Perception Policy Optimization for Multimodal Emotion Reasoning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-25T21:31:38.450382Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.25325"},"observation_digest":"sha256:32e111bcfe6837dbe63fa24a4a7607a70fe999ec231b84fd401c9ab87e536d95","observation_id":"be526fec-bd7e-4d07-86f0-23097d16a4f7","resolution":{"observed_at":"2026-07-04T19:20:06.288028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:af61276b04053273969cd70e845c99984163121e15c90aaffdfcc6a14ffc05e3","observation_id":"db441dfa-501f-404a-b6d7-55eb6216d76b","resolution":{"observed_at":"2026-06-29T18:23:51.450720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2607.01667","last_updated":"2026-07-02T03:47:45Z","snapshot_observed_at":"2026-08-05T09:34:18.453279Z","submitted_at":"2026-07-02T03:47:45Z","title":"Temporal and Cross-Modal Alignment for Enhanced Audiovisual Video Captioning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-03T16:37:06.384435Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.01667"},"observation_digest":"sha256:68cdfd3a9aa7edf1cd46e8366285485e47bb97e40fda227b6974e48683a064de","observation_id":"4f5011fd-6082-4ad2-83be-cf2feec23b41","resolution":{"observed_at":"2026-07-03T16:38:39.614890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-14T12:48:58.688011Z","title":"arXiv preprint arXiv:2506.21277 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10299","last_updated":"2026-07-11T13:04:24Z","snapshot_observed_at":"2026-08-08T22:46:15.287802Z","submitted_at":"2026-07-11T13:04:24Z","title":"Empowering Long-form Omni-modal Understanding with Robust Audio Perception","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T12:48:58.688011Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.10299"},"observation_digest":"sha256:7961c38f7d905432233a3fda71e2b6fa419b756260e3089dfeec9395a2583c6e","observation_id":"8890fdbd-95f2-49ea-9cb8-00dcbccba527","resolution":{"observed_at":"2026-07-14T12:48:58.688011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-01T18:40:15.585890Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17243","last_updated":"2026-07-19T13:24:40Z","snapshot_observed_at":"2026-08-11T00:58:54.308045Z","submitted_at":"2026-07-19T13:24:40Z","title":"LenGuard-GPC: Length Guarding with Guided-Prompt Consistency for Spatial Reasoning Reinforce Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:40:15.585890Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.17243"},"observation_digest":"sha256:ca94ab6878b810eacc65a5773fdf38add029f96fec408fd7f596b80ec21b0cb7","observation_id":"6dedb69d-cfeb-400f-85af-d9d6873b62f4","resolution":{"observed_at":"2026-08-01T18:40:15.585890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-01T03:25:31.638356Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T03:25:31.638356Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:48bcc0df10b921cb9099bbb6ff69894cbbe53e4074e273baaeb398e1824ea2d4","observation_id":"7602b7d7-0cd3-4c99-ad6b-1853d8bd6901","resolution":{"observed_at":"2026-08-01T03:25:31.638356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-04T04:02:54.515743Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23193","last_updated":"2026-08-02T03:37:40Z","snapshot_observed_at":"2026-08-09T12:07:58.075639Z","submitted_at":"2026-07-25T13:16:04Z","title":"OmniScope: Modality-Decoupled Token Compression for Omnimodal Large Language Models","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T04:02:54.515743Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2607.23193"},"observation_digest":"sha256:0f16b3ed46b1248d5a863c9c4c841c2dad2b064a11f6269d12e98bafbf62031b","observation_id":"2bcccdc2-9feb-42fb-acce-f629ddb82464","resolution":{"observed_at":"2026-08-04T04:02:54.515743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-05T12:00:10.926459Z","title":"Humanomniv2: From understand- ing to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03812","last_updated":"2026-08-04T15:23:42Z","snapshot_observed_at":"2026-08-12T08:48:18.881148Z","submitted_at":"2026-08-04T15:23:42Z","title":"OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T12:00:10.926459Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.03812"},"observation_digest":"sha256:eed67d7d76d541ab9a3c51e90bedc437b657a07374e6da7fbcf1cc43f02b5e85","observation_id":"5ff0a44c-6bed-496d-a2cd-b373b08cf750","resolution":{"observed_at":"2026-08-05T12:00:10.926459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-08-10T18:13:44.385618Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context.arXiv preprint arXiv:2506.21277, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06930","last_updated":"2026-08-07T08:03:51Z","snapshot_observed_at":"2026-08-12T19:11:09.598205Z","submitted_at":"2026-08-07T08:03:51Z","title":"AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:13:44.385618Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2608.06930"},"observation_digest":"sha256:434c339df41127929efc8825daf4ea36d92f6d41d6c058f128aa3608fe955e27","observation_id":"1074ca18-4c48-469d-a37d-db46b91920bc","resolution":{"observed_at":"2026-08-10T18:13:44.385618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21277/citation-record","integrity":"/paper/2506.21277/integrity","json":"/paper/2506.21277/citation-record.json","paper":"/paper/2506.21277"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T22:36:13.100076Z","title":"Qwen2. 5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.100076Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:81945894b4dd749245c8b018ab8512889d34f4491ca547c1afac543dd45b9d7a","observation_id":"d9bc3846-ed5c-434e-b476-f42861c1cec7","resolution":{"observed_at":"2026-08-06T22:36:13.100076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.189958Z","title":"Ocean-omni: To understand the world with omni-modality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.189958Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:6665c168d4e15eda6206134495b51092728eb1a8ee16ef144eee794529e8388c","observation_id":"02c0e5a7-4ff0-45df-83de-54ac2fc6f8d4","resolution":{"observed_at":"2026-08-06T22:36:13.189958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-10T02:46:21.304913Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-06T22:36:13.250680Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.250680Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:4e1ed92973f3aff19de17070c4a09ccb113c6fdb5611d8a8223f59e5cec7cb24","observation_id":"b21fc665-8563-4dac-84d1-1b4f15f5c7a2","resolution":{"observed_at":"2026-08-06T22:36:13.250680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01957","snapshot_observed_at":"2026-08-06T22:36:13.311095Z","title":"Vita-1.5: Towards gpt-4o level real-time vision and speech interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.311095Z"},"links":{"cited_paper":"/paper/2501.01957","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:942668bea2468a94b31fbe19279c9e17772283d12845edcee6d736af1bab76cc","observation_id":"d5cdd6a8-e1dd-4942-a1e9-e3d1f4c900d9","resolution":{"observed_at":"2026-08-06T22:36:13.311095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:36:13.354539Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.354539Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:1115d0456e16191aba8262b66aaf19d3b5245ec32233807594d25335d2e4be85","observation_id":"cc1a1c1b-483e-4412-9a66-b0bac0933d76","resolution":{"observed_at":"2026-08-06T22:36:13.354539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-06T22:36:13.414790Z","title":"Mm-eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.414790Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:6ae7e74d3dbad6a7e7cfb68a7c3d5e500eb6f58262c5272442fbc3beba87df0f","observation_id":"fccec2a2-899d-4fb8-9ec7-dcb3dea65492","resolution":{"observed_at":"2026-08-06T22:36:13.414790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-06T22:36:13.542217Z","title":"Visual-rft: Visual reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.542217Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:8e140d79bb711db470529c4f97859781fe5d16d102f9d3f46c4a2d109a067577","observation_id":"2017c838-81a4-459c-89f9-da640f51f34e","resolution":{"observed_at":"2026-08-06T22:36:13.542217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-06T22:36:13.605014Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.605014Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:35e419327eb0a63b53be4c9de294420593b41765e943dade562e4fc684a1f1a2","observation_id":"0a69b6e7-73fe-43b2-a617-8f53fb280752","resolution":{"observed_at":"2026-08-06T22:36:13.605014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T22:36:13.642332Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.642332Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:0a224778e2d922939d18aef457ddf82bc22781e6fb2871ff60b7d6675c176c9b","observation_id":"83c73b5c-953f-4b72-b537-44a7165a64ef","resolution":{"observed_at":"2026-08-06T22:36:13.642332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.716590Z","title":"Let’s verify step by step,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.716590Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:ddf2f4def49320fd8eec2fb194f430b0d95c507c70368c5ef93b919382fdc3bf","observation_id":"2e8db14b-11e6-41f0-95b6-b26a32bac4a4","resolution":{"observed_at":"2026-08-06T22:36:13.716590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.791285Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.791285Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5eb3c2f84d8e9671c68752181bf7529a6b0b517a4394f2897118c854c16f4319","observation_id":"00094bd8-5090-4b3d-a269-be2a6a281e40","resolution":{"observed_at":"2026-08-06T22:36:13.791285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.854051Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.854051Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:0f4db05303fbe652567276dbfcebaccbdf5c05197a0b737b11f2aeda230c8574","observation_id":"c2c5ed5d-25b5-49d3-b8da-6b4715ff9d5c","resolution":{"observed_at":"2026-08-06T22:36:13.854051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:13.927417Z","title":"Daily-omni: Towards audio-visual reasoning with temporal alignment across modalities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:13.927417Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:99815f7eeb57be231c24f1fb35ea39554ac308dbab3fa25edf998a22a12802bc","observation_id":"cadeb560-c2f2-400e-90c2-e440629f71fa","resolution":{"observed_at":"2026-08-06T22:36:13.927417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-08-12T16:10:35.170069Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-06T22:36:14.008552Z","title":"Worldsense: Evaluating real-world omnimodal understanding for multimodal llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.008552Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:6fedbcfe597fcc11fc332eac5def505610f5c357a9ad5c31b4f37a7b80153fc8","observation_id":"4e3c89a2-e02d-4033-8cbf-0a45e2aebf3e","resolution":{"observed_at":"2026-08-06T22:36:14.008552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-10T14:34:53.812449Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-08-06T22:36:14.070930Z","title":"Hu- manomni: A large vision-speech language model for human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.070930Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:611f9fe1d89797c9a16a36ad794e4064d0f3605bd14951e0150a12696f4fbe01","observation_id":"b6abf601-e5a5-40b6-998a-9d42fbc6d159","resolution":{"observed_at":"2026-08-06T22:36:14.070930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T22:36:14.132504Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.132504Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:2391e65517843a011fe495201afc98038f1e6a4558e35dde28091c524ff8c9ad","observation_id":"8fd7646a-2680-4dfc-ad4e-60c889f0c778","resolution":{"observed_at":"2026-08-06T22:36:14.132504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T11:44:25.110955Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-06T22:36:14.198672Z","title":"Internlm- xcomposer2. 5-omnilive: A comprehensive multimodal system for long-term streaming video and audio interactions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.198672Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:9c3c041fc4398ad6a78c8d6344b2811e5c9ed0b9b5d0616e5b27cc5502b8ba0b","observation_id":"3ec31ea1-a90e-4493-a56b-c09be0b7b9bb","resolution":{"observed_at":"2026-08-06T22:36:14.198672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12769","last_updated":"2025-03-17T03:05:31Z","snapshot_observed_at":"2026-08-08T06:39:01.516661Z","submitted_at":"2025-03-17T03:05:31Z","title":"ViSpeak: Visual Instruction Feedback in Streaming Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12769","snapshot_observed_at":"2026-08-06T22:36:14.252623Z","title":"Vispeak: Visual instruction feedback in streaming videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.252623Z"},"links":{"cited_paper":"/paper/2503.12769","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:925a9287c4a56f588388385ac4ab26d41040f369f4825d6d7381e68ccde801de","observation_id":"dac0beed-5947-41bd-acb0-9d2fb423d933","resolution":{"observed_at":"2026-08-06T22:36:14.252623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-06T22:36:14.298315Z","title":"Video-mmmu: Evaluating knowledge acquisition from multi-discipline professional videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.298315Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:f90ef37097e10d1ab93e863d7e17145d5c686e231443c4877975de5e2ec69db9","observation_id":"eb3617e0-da3f-4432-a830-7d9fd7b958eb","resolution":{"observed_at":"2026-08-06T22:36:14.298315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:18.425958Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis,","venue":null,"work_id":"ad5465b8-8186-42d1-bfc9-0caca25c3fbb","year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.371699Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:fdbc0a1625889ec562472ad71639ff696153d31eb6421e3097ef5fb8976ee8a8","observation_id":"e1e885b5-8e18-4d07-801f-3ce16ed229f2","resolution":{"observed_at":"2026-08-06T22:36:18.497671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18152","last_updated":"2025-04-25T08:05:32Z","snapshot_observed_at":"2026-08-07T15:59:17.660418Z","submitted_at":"2025-04-25T08:05:32Z","title":"ActionArt: Advancing Multimodal Large Models for Fine-Grained Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18152","snapshot_observed_at":"2026-08-06T22:36:14.442972Z","title":"Actionart: Advancing multi- modal large models for fine-grained human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.442972Z"},"links":{"cited_paper":"/paper/2504.18152","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5e79d44793a0699a16586c6366f3c1c7173d3cbb444cacd96810df9b318eb4f4","observation_id":"da4ef8b4-87b9-44b4-bb5c-c0544257c32a","resolution":{"observed_at":"2026-08-06T22:36:14.442972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:18.246018Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi,","venue":null,"work_id":"6cb1bd27-7934-4e12-905a-a46573184193","year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.506749Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:1d6c44111f279e0fbd39f4c1cc8e91734f9d12a83d083e9814f178bf2f0e1287","observation_id":"868b216d-5934-4f50-84e1-78e86dcae62b","resolution":{"observed_at":"2026-08-06T22:36:18.346314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:14.573744Z","title":"Omnibench: Towards the future of universal omni-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.573744Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:b3fd607a6a5daefdd2d9af0a5fd7d7a990a0faf621ab751d319f80bc7c2786d9","observation_id":"0ccc3c08-c875-420a-b814-3aef9656fe1c","resolution":{"observed_at":"2026-08-06T22:36:14.573744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T22:36:14.648069Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.648069Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:1c69d32dfbbd49907e2ae4c8d0aeea10d50361de3a7f47acb2220f2175f8eaa4","observation_id":"7762b41f-f762-4dd8-8538-925bb04c6bbb","resolution":{"observed_at":"2026-08-06T22:36:14.648069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-06T22:36:14.709508Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.709508Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:b00ab6978e18a70041eaab05a200763865e4e2e621eea0e33a1a4f7098e50715","observation_id":"be188088-53f3-405c-8485-d3c128398b7b","resolution":{"observed_at":"2026-08-06T22:36:14.709508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-12T15:08:59.751071Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14432","snapshot_observed_at":"2026-08-06T22:36:14.773345Z","title":"Insight-v: Exploring long-chain visual reasoning with multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.773345Z"},"links":{"cited_paper":"/paper/2411.14432","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:90e9da2c4eb6168f969e1f46043aee608bca5e10c4d39b1237543498f6b98f07","observation_id":"e3a3aa44-7bc6-4e3b-b410-5bbf810d6588","resolution":{"observed_at":"2026-08-06T22:36:14.773345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:14.841838Z","title":"Visionary-r1: Mitigating shortcuts in visual reasoning with reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.841838Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:98a0bdf29b59d936b00cf27058b4905581458dc692791aad0086b038ef5cb192","observation_id":"7acb12a4-1f90-432c-a59d-a77bcbe0afa5","resolution":{"observed_at":"2026-08-06T22:36:14.841838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12432","last_updated":"2025-05-18T14:08:03Z","snapshot_observed_at":"2026-08-12T09:06:27.803707Z","submitted_at":"2025-05-18T14:08:03Z","title":"Observe-R1: Unlocking Reasoning Abilities of MLLMs with Dynamic Progressive Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12432","snapshot_observed_at":"2026-08-06T22:36:14.896841Z","title":"Observe-r1: Unlocking reasoning abilities of mllms with dynamic progressive reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.896841Z"},"links":{"cited_paper":"/paper/2505.12432","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5fb79997fbf35d208a226f8861419f3fc6730a7c3333c134327d7091fa87d5dd","observation_id":"ccc0b7ab-2e2b-4db4-ad07-1df3b15e635b","resolution":{"observed_at":"2026-08-06T22:36:14.896841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-08-06T22:36:14.965189Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforce- ment learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:14.965189Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5677cca861b761357ca38c5eb958648ca41c2bdb913d7f61f9afea1c7b75d211","observation_id":"b5e06ef8-e5bd-4aa1-a082-be15c5a55d81","resolution":{"observed_at":"2026-08-06T22:36:14.965189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-06T22:36:15.038514Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.038514Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:8884ec8ff8fc7e9f91d427d2626a8e95831a4f39f002efd7c4dda860296176e8","observation_id":"2caf0f52-2c2f-4cb8-bcf5-c365bbbc7f9b","resolution":{"observed_at":"2026-08-06T22:36:15.038514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-06T22:36:15.103448Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.103448Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:51aff256e70d85cc5b361e8903ed6ab5ef0cf57088049cd99985edd6e0c709cf","observation_id":"8f50cf77-265a-42b5-a02d-2589dfdb4edc","resolution":{"observed_at":"2026-08-06T22:36:15.103448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-08-10T17:10:37.256228Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T22:36:15.170351Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.170351Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:029b41e020da363a77e728cd533a5b820e03b73044b1a26ed4fafe8f522bfbb9","observation_id":"41b50db4-1a75-499d-8957-a94752de91bb","resolution":{"observed_at":"2026-08-06T22:36:15.170351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:18.121868Z","title":"Social-iq: A question answering benchmark for artificial social intelligence,","venue":null,"work_id":"bf74e88e-25a1-48ae-a161-7ffe683ff4a3","year":2019},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.224232Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:2f71acba18d66fe22863b2437912d837eaac9af7def7b64ab1fc0a08de4783f4","observation_id":"976133f1-7b17-43e2-9abe-947893c2214f","resolution":{"observed_at":"2026-08-06T22:36:18.184139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:17.998852Z","title":"Social-iq 2.0 challenge: Benchmarking multimodal social understanding,","venue":null,"work_id":"fa1bf5cb-9a59-4e45-9f7d-3146a42dcea3","year":2023},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.295001Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:97092ef1729da71c45650500a82251a4b046a3e2e82b636f62bcc82d39a65132","observation_id":"6f381da0-0ce4-4880-bcce-f2d97caca2c4","resolution":{"observed_at":"2026-08-06T22:36:18.047248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15401","last_updated":"2024-05-23T11:42:08Z","snapshot_observed_at":"2026-07-06T15:47:15.230195Z","submitted_at":"2023-06-27T11:54:57Z","title":"Explainable Multimodal Emotion Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15401","snapshot_observed_at":"2026-08-06T22:36:15.352601Z","title":"Explainable multimodal emotion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.352601Z"},"links":{"cited_paper":"/paper/2306.15401","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:4f45103369ac3725ca25918b0425be8502d9b2e8e384c2834c7a0e47f96ae1a1","observation_id":"6fb568fc-47de-4fac-9f85-d4df837e52ca","resolution":{"observed_at":"2026-08-06T22:36:15.352601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12274","last_updated":"2025-06-04T03:38:02Z","snapshot_observed_at":"2026-08-08T12:42:10.938930Z","submitted_at":"2024-07-17T02:44:26Z","title":"MDPE: A Multimodal Deception Dataset with Personality and Emotional Characteristics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12274","snapshot_observed_at":"2026-08-06T22:36:15.404271Z","title":"Mdpe: A multi- modal deception dataset with personality and emotional characteristics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.404271Z"},"links":{"cited_paper":"/paper/2407.12274","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:a7b9a4fad7a92be2ae65f5b87af8a50b3ffa4795483ed0fd23c4dadada9c3713","observation_id":"eff13216-134e-4527-abcc-8b7c9b4f2b5c","resolution":{"observed_at":"2026-08-06T22:36:15.404271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T22:36:15.530089Z","title":"Dapo: An open-source llm reinforcement learning system at scale,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.530089Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:356affad02fcdd3095ac386669689c4b80f2ce25a932cdb97bf3e1114a0ad0b2","observation_id":"0ac7f971-756b-4df0-a07a-adb9a148390e","resolution":{"observed_at":"2026-08-06T22:36:15.530089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-12T02:21:51.598634Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-06T22:36:15.612633Z","title":"Understanding r1-zero-like training: A critical perspective,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.612633Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:1906b2a63998e44bd5b8d468bcc7c6ed9f25965a38cdf4a686f8d2f3e0023a16","observation_id":"6e4ade0f-7057-44cf-9251-b15672f059d8","resolution":{"observed_at":"2026-08-06T22:36:15.612633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:15.669533Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.669533Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:ee089165e20c9f181160014d0ba971963238c848640dfc86493e453437732130","observation_id":"737c5beb-ed58-4d15-bef9-3c84af483d50","resolution":{"observed_at":"2026-08-06T22:36:15.669533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:15.737016Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.737016Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:00c8028970db53db513083a928505568802816864f9dfc2016bf4b57164383b9","observation_id":"65645993-1ed6-42cb-9e0d-07efdf6be16a","resolution":{"observed_at":"2026-08-06T22:36:15.737016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T22:36:15.835979Z","title":"Video-r1: Reinforcing video reasoning in mllms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.835979Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:7e5672b26f5752a6dc71080f6c35e49ca5df50d2b2aebe8c7c632e9e43da73d2","observation_id":"dab78a1e-8eb2-4f93-a1f6-d2595de50d6e","resolution":{"observed_at":"2026-08-06T22:36:15.835979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:17.845196Z","title":"Gemini 2.5 pro,","venue":null,"work_id":"56abac58-cb38-4941-a9b4-de8800865ced","year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.883030Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:11c8e28a0fa4dd91e7b8d5b2067b1164b1074a1eb4b89bed26fd431a310cc74b","observation_id":"cc07c2b5-094e-49ea-8069-d1d9f188f4d7","resolution":{"observed_at":"2026-08-06T22:36:17.887554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:15.960063Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.960063Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:5f2abaea7e2958cde145aafc02c41442d355bf7a00f43cffb355e3fcba1f6d52","observation_id":"361cf6a6-743f-43ea-9829-93aa50d84b9a","resolution":{"observed_at":"2026-08-06T22:36:15.960063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T22:36:16.021781Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.021781Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:e294674d535bb204bf2c3eb933ee46cbdb354bb67d53796e8818c00b7d46474d","observation_id":"dd9cc03c-bc9a-42bf-9f5a-a2e6bf2ac43f","resolution":{"observed_at":"2026-08-06T22:36:16.021781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:36:17.712256Z","title":"Introducing the next generation of Claude,","venue":null,"work_id":"2136a641-6864-476a-b8c7-2ef0dfad3d61","year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.124771Z"},"links":{"citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:7a8d7b4443bc54c92857ebb535a616341dbb9406feabc472c0b2ad83df404580","observation_id":"a0a0d3ee-7351-42c2-8670-9c7d5b0507d0","resolution":{"observed_at":"2026-08-06T22:36:17.754014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:36:16.173667Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.173667Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:da1926a32e9c8cdbad7644d263bf61c3f988243caeb05d1a7321ffad48d16a65","observation_id":"41a5225d-a5b5-4634-887a-413f92aba628","resolution":{"observed_at":"2026-08-06T22:36:16.173667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T22:36:16.270052Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.270052Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:83b2d9e89a7f7859a3554aaf42250576dbfc112576e6349759436d9a21d10b84","observation_id":"942a1024-803c-49a2-93fa-b668823c8534","resolution":{"observed_at":"2026-08-06T22:36:16.270052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-06T22:36:16.328116Z","title":"Openai o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.328116Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:eb317faa103eb1ea3e0aa6cb8276307df25bb0b8c2b227ee7bbd65f8e40d03d8","observation_id":"64396dc5-da23-4b78-9b50-770932dda3d7","resolution":{"observed_at":"2026-08-06T22:36:16.328116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07653","last_updated":"2024-07-10T13:34:14Z","snapshot_observed_at":"2026-08-05T16:35:40.046172Z","submitted_at":"2024-07-10T13:34:14Z","title":"AffectGPT: Dataset and Framework for Explainable Multimodal Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07653","snapshot_observed_at":"2026-08-06T22:36:16.371915Z","title":"Affectgpt: Dataset and framework for explainable multimodal emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:16.371915Z"},"links":{"cited_paper":"/paper/2407.07653","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:e92e86f49f0e1ce1635e963fb04e791957adbe9ee9ccc88b55ccdea26f0b1566","observation_id":"c104b7a9-1c1f-41f6-97fa-cccf779cf544","resolution":{"observed_at":"2026-08-06T22:36:16.371915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 24 inbound Pith citation observations for arXiv:2506.21277."}