{"as_of":"2026-08-19T23:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e9bdd2a4d4faedf3699cd8f5a34a6e5184b639e81f20c698e1f1c922b233db30","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:59:25.799236Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00958/citation-record","integrity":"/paper/2506.00958/integrity","json":"/paper/2506.00958/citation-record.json","paper":"/paper/2506.00958"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:59:19.453884Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.453884Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:f20eefdf858d839cbc3a610077b5ebad8e9c0208843f5d8605a40f000c208cd4","observation_id":"6f12c60c-123a-4f1a-9cd4-b10f9ec6505f","resolution":{"observed_at":"2026-08-07T11:59:19.453884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:33.437561Z","title":null,"venue":null,"work_id":"943e7209-a650-4ae3-9eb9-06fbb99f488b","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.519428Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:2b4faeb1442f5f28eafb53c36e3eb514e9041365317ff7a15155d473b2534cda","observation_id":"e1dcd1dd-f6f4-4000-91c2-32361fac9c39","resolution":{"observed_at":"2026-08-07T11:59:33.492866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-16T15:51:36.830951Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-07T11:59:19.626819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.626819Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:c82e1778c1bfd7e0dfcc068318ad7ce2a481720c69d6a8f7cec0e194d8ace5ff","observation_id":"51c85230-8e71-4ed3-8e10-b43990a347e7","resolution":{"observed_at":"2026-08-07T11:59:19.626819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:19.697580Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.697580Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:2e79a582836aebbe94283e953dd2f8c15e14816874a9bbebbd073979bc138823","observation_id":"29f9e4d9-ba74-48a3-a788-def7e57c6ed3","resolution":{"observed_at":"2026-08-07T11:59:19.697580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:33.271468Z","title":null,"venue":null,"work_id":"cdfde412-ae67-41bf-8fff-43de7127bb65","year":2000},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.762846Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:7f6c6759e258d974c1ac22e6e8134cced49f5f531e4eaf52cd16926120a834cf","observation_id":"b40bdd7f-1bc6-46b5-857a-138ac4be4dca","resolution":{"observed_at":"2026-08-07T11:59:33.338126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:19.820401Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.820401Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:22eb0d99c110e7866b5fd8ea52f79e77bc6c2af64d55f053ceb2d7af295d5d2c","observation_id":"6081f8bb-c37c-4ce1-ba17-181e56c34569","resolution":{"observed_at":"2026-08-07T11:59:19.820401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:33.093161Z","title":null,"venue":null,"work_id":"876e0bd0-5386-43a0-8386-27fd450229dc","year":2008},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.907063Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:653a84a3805be9485e762289fb6d0a836582b0b8533728baaba5bee1832851d1","observation_id":"b4637a52-1904-4a7f-bc8c-dbe1600e647d","resolution":{"observed_at":"2026-08-07T11:59:33.156784Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14774","last_updated":"2022-10-25T09:34:32Z","snapshot_observed_at":"2026-08-16T16:49:28.373360Z","submitted_at":"2022-06-29T17:16:58Z","title":"TweetNLP: Cutting-Edge Natural Language Processing for Social Media","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14774","snapshot_observed_at":"2026-08-07T11:59:19.999954Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:19.999954Z"},"links":{"cited_paper":"/paper/2206.14774","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:7099c250ec10cb8b33644d59d6c126f38c22cdf5ac86a80af1ea897942ae40fc","observation_id":"860b2bf3-c9a9-4a95-8683-983ed35396f5","resolution":{"observed_at":"2026-08-07T11:59:19.999954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-14T06:42:43.375489Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T11:59:20.070776Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.070776Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:f809aeebbb621fcd4deaa82edcc3d81aeb0af4a4d5efefc86b069bcde216ba8e","observation_id":"8f72479d-5415-4202-af21-b67cb2130398","resolution":{"observed_at":"2026-08-07T11:59:20.070776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:32.950282Z","title":null,"venue":null,"work_id":"5358b3da-0095-4ab9-9e40-0c4401ccde12","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.188589Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:aa5122e4dce73bf07e25b8307fc4f28cf28789e9a603fde739c9dfbf6c0f2090","observation_id":"f4e9ec70-f11f-4479-a697-5aa0cacc2b8e","resolution":{"observed_at":"2026-08-07T11:59:33.031201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:32.783736Z","title":null,"venue":null,"work_id":"7a6d5d90-6794-4aee-a7fb-1429248379ff","year":2014},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.260887Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:e7e91d231856dce223ebecc8a1127c72fdc6a521757b5b0eac8d78d551351c27","observation_id":"bde23dd3-8ba5-426b-a58a-1a56c1847c4c","resolution":{"observed_at":"2026-08-07T11:59:32.856064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:32.637659Z","title":null,"venue":null,"work_id":"b169cee0-ab7c-462c-a13c-180c9cafaa3a","year":2022},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.354669Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:bc19b78d4e11a8d244172a6dec665cd3ad9369517cb3369271d28eee149609b1","observation_id":"d318467e-7fc7-44cc-bfc6-5d1c75b930cc","resolution":{"observed_at":"2026-08-07T11:59:32.720489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:32.492933Z","title":null,"venue":null,"work_id":"3120afac-64d1-4c83-b989-af4499c90860","year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.422218Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:7c1221f0a3921185d8fd33b55514a9610dc5775f3507f80b4d8c5c3237f0d5a7","observation_id":"b0425e68-2b97-481d-b429-d61e0c9961ae","resolution":{"observed_at":"2026-08-07T11:59:32.570993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:32.361211Z","title":null,"venue":null,"work_id":"15189d76-7166-42e6-a2ee-a5ba38d13766","year":1996},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.527930Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:d87530d07b1a8d100aa73a2824922d89ffc9ac450169a6ec2e6c234cff34a906","observation_id":"d7516e18-35dd-4dd8-81b1-fdc2daa8ffc3","resolution":{"observed_at":"2026-08-07T11:59:32.432399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:32.200956Z","title":null,"venue":null,"work_id":"8d0e7ac5-a69c-42d0-bdb2-66519c2dc6a7","year":1990},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.634626Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:a28bd934e2b9e24fd493a69708339ffb05676e1ea269bb644a2790a71fcf2486","observation_id":"46516e5b-1475-41b9-92ea-b38706ec669f","resolution":{"observed_at":"2026-08-07T11:59:32.258797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:31.953089Z","title":null,"venue":null,"work_id":"f486b43f-d00e-4613-9ca3-8b417d44014a","year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.713727Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:e475dce178de24ff2867ea808dccb019654b2767d66c96e29afd16eeca20304d","observation_id":"d0fa4c32-ffac-42ab-822e-5551abcd2866","resolution":{"observed_at":"2026-08-07T11:59:32.088169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:31.719445Z","title":null,"venue":null,"work_id":"a53451b4-19dc-47c5-8c4c-9290c506d2f4","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.788821Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:83f646b3137152f62176dde4d8d1831ea4832e9c759c7fde0a8ab7439508549a","observation_id":"4da3c84e-57da-4be3-8c2d-68b440c20d84","resolution":{"observed_at":"2026-08-07T11:59:31.817477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-12T20:12:20.465098Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-08-07T11:59:20.864211Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.864211Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:f829ad77a0d66de65dde91539082280dc94ff92b7cde0450f49eec5ec3bb67aa","observation_id":"56fc9143-83ed-43ae-bcb7-b354e1f77792","resolution":{"observed_at":"2026-08-07T11:59:20.864211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:31.466118Z","title":null,"venue":null,"work_id":"8bfc698a-019f-48ff-8e7f-d39953e756f6","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.928518Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:ec208f08d45d0ca4946c59d50fb8e3686947df5e2d1e3a7106e4a32e772b56bc","observation_id":"958640a1-231d-44a7-accf-0afd2707ce36","resolution":{"observed_at":"2026-08-07T11:59:31.596815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16529","last_updated":"2023-08-31T08:20:04Z","snapshot_observed_at":"2026-08-16T15:04:23.766038Z","submitted_at":"2023-08-31T08:20:04Z","title":"Developing Social Robots with Empathetic Non-Verbal Cues Using Large Language Models","version":1},"cited_work":{"arxiv_id":"2308.16529","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.16529","snapshot_observed_at":"2026-08-07T11:59:26.275761Z","title":"Developing Social Robots with Empathetic Non-Verbal Cues Using Large Language Models","venue":"cs.RO","work_id":"22a31f63-f6f9-4767-ac03-7bde587bf178","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:20.991887Z"},"links":{"cited_paper":"/paper/2308.16529","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:be79e71d962df2bc2794d9f071e853396e97ce1e973a370f4257fbdfa37f8cc5","observation_id":"dad33d52-14ba-4fd0-a972-653c6bd93bc0","resolution":{"observed_at":"2026-08-07T11:59:26.351463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-07T11:59:21.080473Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:21.080473Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:60722dfc0b004c28898cffaefc9ad42b3b5136510c6dddf27a6547a860c670e2","observation_id":"db66c58f-dd38-4da6-85ac-4bbd1d2bfdf4","resolution":{"observed_at":"2026-08-07T11:59:21.080473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:31.248623Z","title":null,"venue":null,"work_id":"f02453ec-6d18-41da-8454-8643d2adc9e0","year":2017},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:21.186835Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:4900f8ef0a3692d014842af74214d7b88db7320bcf62ac0517f9506b0c5e022d","observation_id":"78c2fa84-339b-461e-8f7b-32f3f0b43ac1","resolution":{"observed_at":"2026-08-07T11:59:31.331663Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:31.089630Z","title":null,"venue":null,"work_id":"52b36997-f33e-477f-9f2a-91268161db0e","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:21.334759Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:f454a88bea99295a51aae7ab46c43dcfabdfd2878a543f5638b6b5275e02fdf9","observation_id":"38d3e38b-00f3-4405-b3e2-b7e8675a648d","resolution":{"observed_at":"2026-08-07T11:59:31.164438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:30.671800Z","title":null,"venue":null,"work_id":"daab642e-3982-44af-95fb-368c3469fb89","year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:21.466967Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:7573031b5443b0830518cbd9d81447d404be19cf0eaefd7768b7a9628e00aa40","observation_id":"8b53fdc0-df68-4976-973d-661d7c439218","resolution":{"observed_at":"2026-08-07T11:59:30.971304Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:30.444061Z","title":null,"venue":null,"work_id":"b1716f14-1605-4b0b-bdc7-42f96bbe79ff","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:21.572858Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:7f4f6e5ee28e8a1b762bb6124d8d945b2b6ac30c6f68dcb0cbaff5fc7184560e","observation_id":"e24b3ef8-2ae5-40e3-8ea5-48c6dad59826","resolution":{"observed_at":"2026-08-07T11:59:30.530872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:30.202274Z","title":null,"venue":null,"work_id":"0d6d3d4a-3e33-4321-a347-a8766d5e1ab4","year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:21.745382Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:dad3a6b46dc6cdf44a4b18963333e40f13d33403a8ee31556d01d034bc3b1e91","observation_id":"766c688e-a80f-41c7-8ae0-9a0305495d8d","resolution":{"observed_at":"2026-08-07T11:59:30.330028Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:29.967639Z","title":null,"venue":null,"work_id":"99a42a42-23c5-40ab-8e4b-3277a2474af8","year":2022},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:21.899955Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:e721f9383c60828a8f799c2b040c8965f34cd23b7c9a99279539575943c39555","observation_id":"97a34e2a-beb2-4364-aac3-d1500b24f498","resolution":{"observed_at":"2026-08-07T11:59:30.098806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:22.064214Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.064214Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:1e009678a103e347dbd01a5a21df2e0d33705c88f1ef210c01658eb6c2d5c5c8","observation_id":"34f0454f-a86c-4e75-8215-4b0e147797c3","resolution":{"observed_at":"2026-08-07T11:59:22.064214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:29.659873Z","title":null,"venue":null,"work_id":"ffd022d3-8611-4242-94e2-f07a620b2844","year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.221752Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:9fe57070ac13b75dbaff8413fda3d3fcc63f000e3cd03a5bb59f8b980eb2d4a0","observation_id":"250114a7-7b3b-403f-a95a-410e1723ab41","resolution":{"observed_at":"2026-08-07T11:59:29.792148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11541","last_updated":"2023-06-20T13:53:05Z","snapshot_observed_at":"2026-08-16T15:22:32.966845Z","submitted_at":"2023-06-20T13:53:05Z","title":"Audio-Driven 3D Facial Animation from In-the-Wild Videos","version":1},"cited_work":{"arxiv_id":"2306.11541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.11541","snapshot_observed_at":"2026-08-07T11:59:26.022865Z","title":"Audio-Driven 3D Facial Animation from In-the-Wild Videos","venue":"cs.CV","work_id":"b714cac3-a1b1-4fc6-a1b4-2ed486856a61","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.378657Z"},"links":{"cited_paper":"/paper/2306.11541","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:85f1dc93e0bc252ffd45c216e8c562c4efe5a2733a298f051defa41517b21afd","observation_id":"6f1f3954-e0aa-4b34-b065-1b6736913408","resolution":{"observed_at":"2026-08-07T11:59:26.107780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12978","last_updated":"2023-10-19T17:59:46Z","snapshot_observed_at":"2026-08-18T12:29:37.071756Z","submitted_at":"2023-10-19T17:59:46Z","title":"HumanTOMATO: Text-aligned Whole-body Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12978","snapshot_observed_at":"2026-08-07T11:59:22.444795Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.444795Z"},"links":{"cited_paper":"/paper/2310.12978","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:b9d5d686d1d15fdbd53c6ef342374e9c619d92f58f8528163aca439ac2657fb5","observation_id":"ba0088f1-c773-44d5-b434-ea3112deb492","resolution":{"observed_at":"2026-08-07T11:59:22.444795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:29.404539Z","title":null,"venue":null,"work_id":"35fb5088-c461-44d2-8099-a4801e4c597c","year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.526326Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:cfb9af527e0c3c9875f1d06f78e87c614cff660671264cc94b3c2fb0f45fff16","observation_id":"d481726f-9bcd-4ca3-8b77-cace9d7ba9cd","resolution":{"observed_at":"2026-08-07T11:59:29.520080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:29.234164Z","title":null,"venue":null,"work_id":"9613cdba-1c1a-4068-a074-385843966e83","year":2022},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.616353Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:3a2462d8ce6a6506cdf8890c6331dbba3aa01c40b23d44581c66314c086e2421","observation_id":"10509f79-d73b-4e6a-b169-0cb86381f7be","resolution":{"observed_at":"2026-08-07T11:59:29.315869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:29.079221Z","title":null,"venue":null,"work_id":"1da972eb-7513-452b-8e72-a5687e3060f2","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.698975Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:925a002dd8c6d30a745a3836b71604fd47215a2f56efb0b675496d4441ff6ec7","observation_id":"3b68c564-0360-43c2-87a0-c078019e3ac8","resolution":{"observed_at":"2026-08-07T11:59:29.159538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07867","last_updated":"2024-08-02T15:05:47Z","snapshot_observed_at":"2026-08-16T13:43:55.179056Z","submitted_at":"2024-06-12T04:48:36Z","title":"Let's Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07867","snapshot_observed_at":"2026-08-07T11:59:22.763255Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.763255Z"},"links":{"cited_paper":"/paper/2406.07867","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:d41c2a6420b786728f03fd8b221c9e8a9029a880132c827f46e23f67cc1a0b3b","observation_id":"00a118d7-a451-4889-b8c8-135d5a1cba9b","resolution":{"observed_at":"2026-08-07T11:59:22.763255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:28.923281Z","title":null,"venue":null,"work_id":"a79e9f66-b576-473f-b035-768fc72aa18f","year":2019},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.842934Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:00b7e125d5fa07afd5505d349ba4d41d7ad3a667396145be6732eaaf7c8cdfd4","observation_id":"104b295b-dd48-47cf-a2a3-3f5c0cbb49a9","resolution":{"observed_at":"2026-08-07T11:59:28.966070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:28.821593Z","title":null,"venue":null,"work_id":"d2c1c9c3-ac8d-4bdc-b980-39c4f312c658","year":2015},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.928593Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:c137137103cb5d97e902709c72e62d57fc1f3ac8ef952e5a9120c42c1afe28aa","observation_id":"11c02013-6294-4496-8bcc-fa59f0905fea","resolution":{"observed_at":"2026-08-07T11:59:28.887250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:28.623172Z","title":null,"venue":null,"work_id":"89910402-88d4-4237-a497-287eee1abe73","year":2019},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:22.997898Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:d84e06164d643fc457757788c16bba06e9e255dead9eb7a3316a347d9fd5edf8","observation_id":"cfee5e2b-b1cf-4467-aeb2-b1f0006eaa35","resolution":{"observed_at":"2026-08-07T11:59:28.715970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:28.452203Z","title":null,"venue":null,"work_id":"542f284d-dbb7-45fd-b605-945de1afbd4a","year":2019},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.058856Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:e3d7c13a47b230c2a22c9872d8a55ac0e9e253352d5f1845a5c28aa57a597f40","observation_id":"c34da036-abdd-4f6f-a1ad-39a2974efc01","resolution":{"observed_at":"2026-08-07T11:59:28.534234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:28.257387Z","title":null,"venue":null,"work_id":"d3de7d5c-0265-4e41-9d15-20d0304c3e7a","year":2018},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.190809Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:fd53866410b5851e11cc538cbdd587405ea29f4c907577bffdfec65dfeb22c26","observation_id":"00b3073c-2f52-4300-92e7-97bd411551bd","resolution":{"observed_at":"2026-08-07T11:59:28.347735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:23.312004Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.312004Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:e6fb1f8341271bf177bed3e3ccf351a96ab9db2b27cf7cac362c14e8e7ce26f8","observation_id":"5a628e21-daaa-4339-b462-6e002c09be33","resolution":{"observed_at":"2026-08-07T11:59:23.312004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:23.446539Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.446539Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:047e744b116c1638764805fc5f2d2f1f95eb7e116f53079b9006d3565dab34e6","observation_id":"03163047-fc9c-499d-8ca8-f43beb04231a","resolution":{"observed_at":"2026-08-07T11:59:23.446539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:23.583672Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.583672Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:fb1cc0c625a8a268e5a99572d9da81de131a17b6858537b30b4762996b467bae","observation_id":"9080ba26-a2a8-4cbb-a4f7-df681b350756","resolution":{"observed_at":"2026-08-07T11:59:23.583672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:23.717182Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.717182Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:185eb287e2723705860c93701ef6f1db82cc3eb28f9b66e147127d96dec50f92","observation_id":"7673667c-25a3-4d2b-bfec-76fa000cc5d6","resolution":{"observed_at":"2026-08-07T11:59:23.717182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17013","last_updated":"2024-10-06T13:46:47Z","snapshot_observed_at":"2026-08-19T05:43:23.017360Z","submitted_at":"2024-05-27T09:57:51Z","title":"Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17013","snapshot_observed_at":"2026-08-07T11:59:23.854848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.854848Z"},"links":{"cited_paper":"/paper/2405.17013","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:9b3a6b383b764cde64c5d78b2bd0c1b811c25a608bf049e91686fb22fa74cf8d","observation_id":"d1711afc-ca5d-4da5-9e44-5ea411074b2b","resolution":{"observed_at":"2026-08-07T11:59:23.854848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:59:23.991320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:23.991320Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:62daf10b4fbbb31a36b739cc8c357c7898fd532ab65fa21a9e5ec65b7c411fdd","observation_id":"08d602e8-eb5d-46a0-b357-634f3c929fd3","resolution":{"observed_at":"2026-08-07T11:59:23.991320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:28.042251Z","title":null,"venue":null,"work_id":"0fe5aee1-67f7-4859-80dc-6170ccc42cbc","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:24.120982Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:dc8b36a75dc6dc92bdd63097a8a169d02244a8d47db855fe98f45464194f2831","observation_id":"745c6465-96e6-4725-86e4-25d4835a3a55","resolution":{"observed_at":"2026-08-07T11:59:28.128843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:27.813316Z","title":null,"venue":null,"work_id":"a5a46771-8912-447d-8503-996c68557811","year":2018},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:24.271719Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:778b355cf5dc17ecfdfd1f84f1aa9fc025f89327cddff953562d9c0ab8e55e26","observation_id":"41ad6f83-8b62-4c40-b898-cffb780061d1","resolution":{"observed_at":"2026-08-07T11:59:27.938772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:27.590544Z","title":null,"venue":null,"work_id":"8490efa9-5f00-4fc3-ac66-8a4762efa624","year":2022},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:24.420070Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:7b0948d0c9ea1cd9c832e27f8f029e03fc11cfcce36d759398b5fd6b722183c3","observation_id":"84d44f75-b4c4-45fc-99b8-27fbfc721e3c","resolution":{"observed_at":"2026-08-07T11:59:27.697890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:27.356102Z","title":null,"venue":null,"work_id":"6f3206b0-c4de-4a4b-8a4b-96972d4c3041","year":2021},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:24.591731Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:348986ba04ddd2ccd901160051ae94d46751fa82a6b5b4bc2d2f92dbdaa4995a","observation_id":"311d69ff-6101-49bd-a0c7-8d45af649f57","resolution":{"observed_at":"2026-08-07T11:59:27.471727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:27.080807Z","title":null,"venue":null,"work_id":"2311fee9-d3ea-4dc8-bf32-1b504877f2fe","year":2021},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:24.736242Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:9b79e25c03952e40f41f840d944330df46c725be0b673a18b888363097b0c4a3","observation_id":"7cd90ad8-f4d9-4752-b9ef-2da06d2bf576","resolution":{"observed_at":"2026-08-07T11:59:27.193570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-07T11:59:24.912279Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:24.912279Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:872314bf272cc92b340058cb239ad1347bddcb1fcc53194eb886b0161ec961da","observation_id":"da3facdb-790f-4540-be94-2eeff4362e69","resolution":{"observed_at":"2026-08-07T11:59:24.912279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:26.819507Z","title":null,"venue":null,"work_id":"53a57915-047a-4b83-a5e4-9329fd424444","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:25.059997Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:7d65890dbc7b37f3830520d8e9bd4c0ad814a0fd8f573b484c75fce422207d19","observation_id":"ca0d1fd3-2830-4dbf-89b4-df416952407f","resolution":{"observed_at":"2026-08-07T11:59:26.928301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:26.582965Z","title":null,"venue":null,"work_id":"a3a1f8ee-d74b-44a0-9801-548aae7148bc","year":2023},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:25.222498Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:f727feef5192eba8f67b74bcdcc67383c925ef129dfbaf55e6263261e7e5e2e8","observation_id":"461341e4-baf5-400e-897c-ebbca59d1b56","resolution":{"observed_at":"2026-08-07T11:59:26.656415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T11:59:25.397734Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:25.397734Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:81b4b72a478ac3fb5c7449658a7d7d13df5229f2bbe994470ee4db3a51b450c2","observation_id":"68b8d748-9d5e-44f9-b000-d3b20dc37dbf","resolution":{"observed_at":"2026-08-07T11:59:25.397734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:25.544752Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:25.544752Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:28a1cd64e7b26115651f215b0609aa6869706a70ffdcd4ab7ab04e4e3c4cb494","observation_id":"28500839-abcf-44a2-82fc-0d27bbb00fdd","resolution":{"observed_at":"2026-08-07T11:59:25.544752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:25.681490Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:25.681490Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:75a51be555e318fcdf338ab1d21402c3cd0bfdc07642db7a1acc17b42b76dc50","observation_id":"f7e87cca-699a-4ac7-b11f-2e8ba62c8344","resolution":{"observed_at":"2026-08-07T11:59:25.681490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:59:25.799236Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:25.799236Z"},"links":{"citing_paper":"/paper/2506.00958"},"observation_digest":"sha256:6d05d6dafdf4ea55e1095fcea509b56db13d1214571af8c534880a5921d703fc","observation_id":"b0ce933e-422b-4787-b628-b9a4978f80e0","resolution":{"observed_at":"2026-08-07T11:59:25.799236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00958","last_updated":"2025-06-01T11:07:25Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T10:56:19.875466Z","submitted_at":"2025-06-01T11:07:25Z","title":"Speaking Beyond Language: A Large-Scale Multimodal Dataset for Learning Nonverbal Cues from Video-Grounded Dialogues"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2506.00958."}