{"as_of":"2026-08-23T20:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89050c465e5affc2af0dc6ca12534d70b0c1e0dab1f477bd6c5024c61017cd46","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:21:49.742464Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18373/citation-record","integrity":"/paper/2504.18373/integrity","json":"/paper/2504.18373/citation-record.json","paper":"/paper/2504.18373"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.505296Z","title":null,"venue":null,"work_id":"08b66dab-93e8-4061-b7bf-07a52a421942","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.522561Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:31b4542acfa508ae680c7a8e0f5933edc652c417e63b6de52057b900f8c3340a","observation_id":"c156dc7e-6ed6-4b74-91d1-87c78db29521","resolution":{"observed_at":"2026-08-16T10:21:50.509931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.489644Z","title":null,"venue":null,"work_id":"67977a15-b109-462b-a8a6-81671d12766e","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.528161Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:c99e8212cd6550645d20aeb61e41c7f6b805c77a50ada472c66af56451e9cf9b","observation_id":"015fdd4d-1705-4e28-8348-9b0c773d601a","resolution":{"observed_at":"2026-08-16T10:21:50.494563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.533166Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.533166Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:6935811c8fcc24a027a065b8a89522c88e003b32b09fab953b1beb78c17d7b65","observation_id":"4dd197c8-8bc7-4f79-b078-49ee3b715fcb","resolution":{"observed_at":"2026-08-16T10:21:49.533166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13205","last_updated":"2020-11-26T09:58:20Z","snapshot_observed_at":"2026-08-19T19:51:22.719917Z","submitted_at":"2020-11-26T09:58:20Z","title":"SLURP: A Spoken Language Understanding Resource Package","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13205","snapshot_observed_at":"2026-08-16T10:21:49.538421Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.538421Z"},"links":{"cited_paper":"/paper/2011.13205","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:5ca59cfb64b5f5cf80633c991ca2d973f41779db98b044eac47e9030111db39b","observation_id":"fb5c8bfb-5e45-4792-8afd-476692746c0f","resolution":{"observed_at":"2026-08-16T10:21:49.538421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.463627Z","title":"Karlsson, Jie Fu, and Yemin Shi","venue":null,"work_id":"a39010b9-0c3b-4265-8090-1b76238bd860","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.544165Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:a940a9f68006745da36123acbb136fd2d182cd3cf012d13a529626800368f877","observation_id":"34acdfb8-8948-488a-88a4-5fa86552c19e","resolution":{"observed_at":"2026-08-16T10:21:50.468598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13679","last_updated":"2024-08-05T13:32:40Z","snapshot_observed_at":"2026-08-20T11:31:16.657772Z","submitted_at":"2024-03-20T15:38:36Z","title":"SocialBench: Sociality Evaluation of Role-Playing Conversational Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13679","snapshot_observed_at":"2026-08-16T10:21:49.548950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.548950Z"},"links":{"cited_paper":"/paper/2403.13679","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:505bc29b6df4dc4bcd0cd13e46544d2157f04b2d63f120d502209707cb24630f","observation_id":"2c445e23-9c31-4d10-b101-2477def26874","resolution":{"observed_at":"2026-08-16T10:21:49.548950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.447020Z","title":null,"venue":null,"work_id":"565fdbe7-f37b-441b-9b28-0dfb2b84914e","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.554881Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:7abd2c0cc5a029bf060e53415709018022fed93eb2d59f9b7b58d8969c265c77","observation_id":"b0cc72bf-b43c-4998-97e8-d86b4e65eaca","resolution":{"observed_at":"2026-08-16T10:21:50.452158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14033","last_updated":"2024-01-15T03:18:25Z","snapshot_observed_at":"2026-08-18T10:53:24.646048Z","submitted_at":"2023-12-21T17:02:06Z","title":"T-Eval: Evaluating the Tool Utilization Capability of Large Language Models Step by Step","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14033","snapshot_observed_at":"2026-08-16T10:21:49.559531Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.559531Z"},"links":{"cited_paper":"/paper/2312.14033","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:7cd205ef9ceaaf58fdfcf25e978bb977be681ae55ed9ef02395a4daa6d61c018","observation_id":"85a838aa-2b5d-47c4-b51b-f4cd430916fa","resolution":{"observed_at":"2026-08-16T10:21:49.559531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.431903Z","title":null,"venue":null,"work_id":"11d266bc-2d91-441a-aea5-593f6093f52a","year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.564412Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:6340d3cb64f260c6ccfe89c80218144fd77633c8d81921162d999aece1f5ecf8","observation_id":"3c5a4096-ddb7-490b-aaa3-117e728085fa","resolution":{"observed_at":"2026-08-16T10:21:50.436560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.415888Z","title":null,"venue":null,"work_id":"aa3bf263-69b6-4c99-96e8-f302f22a1816","year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.569557Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:a2b661cc5e036906dbfd5cba3c5f93ff327b7fd21f3d41ea4dbe8cffa5bdfc1d","observation_id":"b85ba02a-dc27-494c-a67f-489f9833ec1d","resolution":{"observed_at":"2026-08-16T10:21:50.420907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14025","last_updated":"2021-03-25T17:59:08Z","snapshot_observed_at":"2026-08-16T18:36:17.823043Z","submitted_at":"2021-03-25T17:59:08Z","title":"The ThreeDWorld Transport Challenge: A Visually Guided Task-and-Motion Planning Benchmark for Physically Realistic Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.14025","snapshot_observed_at":"2026-08-16T10:21:49.574221Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.574221Z"},"links":{"cited_paper":"/paper/2103.14025","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:5e61c1edb4604ecc0ed8ecb61b20956ac8d7a2e30d99f7d7800673d8c78a5afc","observation_id":"2641f43a-6fc5-41f5-b9e7-8a8285eb3128","resolution":{"observed_at":"2026-08-16T10:21:49.574221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.579498Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.579498Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:9c30a11da17aa11b34782a356bbc6260220103b61a6b181f72cde952b9343774","observation_id":"877ef9a1-0fba-4f1d-b5c8-c344ba955b4b","resolution":{"observed_at":"2026-08-16T10:21:49.579498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.584061Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.584061Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:29cc3c576c588fc4f1456a1b0d67a1d7db87d2eac9a757b18f92813597789529","observation_id":"5f17253d-2e6e-4977-acb0-51487026adcc","resolution":{"observed_at":"2026-08-16T10:21:49.584061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.589122Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.589122Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:eb3780dffa1becb9095a5125401c441a03c86461ccdfc194fcc0c9be347f25f7","observation_id":"f4fdcbde-831e-43a6-b9d1-f687fa3d11e5","resolution":{"observed_at":"2026-08-16T10:21:49.589122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06370","last_updated":"2021-12-13T01:38:37Z","snapshot_observed_at":"2026-08-16T17:35:14.947984Z","submitted_at":"2021-12-13T01:38:37Z","title":"Dependency Learning for Legal Judgment Prediction with a Unified Text-to-Text Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06370","snapshot_observed_at":"2026-08-16T10:21:49.594019Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.594019Z"},"links":{"cited_paper":"/paper/2112.06370","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:0182698b4d6462d092859533a70af61e455819639e56274456258a16e8e9088c","observation_id":"11a6ab6d-8f57-4c2c-8a83-99c17ee45cc1","resolution":{"observed_at":"2026-08-16T10:21:49.594019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.390168Z","title":null,"venue":null,"work_id":"51012719-6f4b-47d9-8814-dd71ff4c6196","year":2022},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.599372Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:83d9664bb058157b38d17668bac060a781d85335708799a6b0f810c0e6d3c355","observation_id":"7e0f9369-7e28-444f-bd69-bfc758cc39a4","resolution":{"observed_at":"2026-08-16T10:21:50.395005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.374354Z","title":null,"venue":null,"work_id":"10bb9dba-dce4-4040-983b-8105198ce553","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.603742Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:61c0286314de580f6d76a8a9fa0e0419c3068a571ddcb899cb4924487ab932f1","observation_id":"6e5f86e8-855a-4bdc-acf4-a6343d4775fd","resolution":{"observed_at":"2026-08-16T10:21:50.379226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.608287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.608287Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:73e0a65579aafeaab1e3b33b826cd5312331ed26a45e9729ede64e71c686e3b1","observation_id":"88d105b9-4570-4e9c-bf91-5753b44c2ccb","resolution":{"observed_at":"2026-08-16T10:21:49.608287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17259","last_updated":"2024-12-23T04:02:46Z","snapshot_observed_at":"2026-08-13T17:31:34.764750Z","submitted_at":"2024-12-23T04:02:46Z","title":"LegalAgentBench: Evaluating LLM Agents in Legal Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17259","snapshot_observed_at":"2026-08-16T10:21:49.612806Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.612806Z"},"links":{"cited_paper":"/paper/2412.17259","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:b3b493200188b68c70fdc6b9593fe468c3656319c879622805d930675cc1bf4b","observation_id":"0c03efc8-bd85-4918-8bd4-433f24b69ccc","resolution":{"observed_at":"2026-08-16T10:21:49.612806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-20T10:21:12.032735Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-16T10:21:49.618129Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.618129Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:1fcd5fb55e81e126b36b63073d685a7bcefa323b59daa0d62f8445aaae70b28c","observation_id":"04809457-7820-40d8-a757-9cd31398669a","resolution":{"observed_at":"2026-08-16T10:21:49.618129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.348411Z","title":null,"venue":null,"work_id":"cf932b34-6960-45bb-9849-ce884be8843e","year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.623014Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:e469c78366fd11d03cd2fa92d142e587693e9f344b075374b65276c3e9d35c4b","observation_id":"0e7b7072-5e61-4435-ba8a-66e39a48eb5c","resolution":{"observed_at":"2026-08-16T10:21:50.353104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15538","last_updated":"2024-02-23T06:25:20Z","snapshot_observed_at":"2026-08-17T05:45:32.513069Z","submitted_at":"2024-02-23T06:25:20Z","title":"AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15538","snapshot_observed_at":"2026-08-16T10:21:49.627727Z","title":"Choubey, Tian Lan, Jason Wu, Huan Wang, Shelby Heinecke, Caiming Xiong, and Silvio Savarese","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.627727Z"},"links":{"cited_paper":"/paper/2402.15538","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:1c3688e46a9a5a9892650c44ab11de77f43eec30b55047a1116ef3ef91bff993","observation_id":"f6db415f-51f3-4d21-8d4a-0c3bbeeb5618","resolution":{"observed_at":"2026-08-16T10:21:49.627727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13178","last_updated":"2024-12-23T20:12:48Z","snapshot_observed_at":"2026-08-20T13:31:05.293801Z","submitted_at":"2024-01-24T01:51:00Z","title":"AgentBoard: An Analytical Evaluation Board of Multi-turn LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13178","snapshot_observed_at":"2026-08-16T10:21:49.632677Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.632677Z"},"links":{"cited_paper":"/paper/2401.13178","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:767bcd91cbd53d3102e0339444aa0600d3af066a818ca8d743b2ddd08858c62e","observation_id":"4e0e3555-0c4b-4f9c-a788-5509a31e6f93","resolution":{"observed_at":"2026-08-16T10:21:49.632677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19346","last_updated":"2024-11-23T08:23:27Z","snapshot_observed_at":"2026-08-16T13:06:02.218179Z","submitted_at":"2024-10-25T07:04:16Z","title":"AgentSense: Benchmarking Social Intelligence of Language Agents through Interactive Scenarios","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19346","snapshot_observed_at":"2026-08-16T10:21:49.637334Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.637334Z"},"links":{"cited_paper":"/paper/2410.19346","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:0fee993805f2614e890194efdf3925cada7e55301c6c9925e52590f174fcf489","observation_id":"74897ccd-d215-45be-a25c-6e765aa93845","resolution":{"observed_at":"2026-08-16T10:21:49.637334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09890","last_updated":"2021-05-03T13:08:55Z","snapshot_observed_at":"2026-08-16T19:12:16.718235Z","submitted_at":"2020-10-19T21:48:31Z","title":"Watch-And-Help: A Challenge for Social Perception and Human-AI Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09890","snapshot_observed_at":"2026-08-16T10:21:49.642253Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.642253Z"},"links":{"cited_paper":"/paper/2010.09890","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:92bbc3b468ff867cb65931568b42ad0a652242024b05b58f448cb807b5411057","observation_id":"8ffce89e-d73f-495d-bc6c-3539ddb5f646","resolution":{"observed_at":"2026-08-16T10:21:49.642253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10568","last_updated":"2024-03-12T08:24:37Z","snapshot_observed_at":"2026-08-22T06:18:38.083465Z","submitted_at":"2024-01-19T09:14:11Z","title":"CivRealm: A Learning and Reasoning Odyssey in Civilization for Decision-Making Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10568","snapshot_observed_at":"2026-08-16T10:21:49.646995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.646995Z"},"links":{"cited_paper":"/paper/2401.10568","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:3f79bbd514f1edea13fa032ba4ea46e6c16df68b654c3dcfaacb170950958c54","observation_id":"860a4597-4aff-4de8-8921-635bbdd4bdd5","resolution":{"observed_at":"2026-08-16T10:21:49.646995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-16T10:21:49.651776Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.651776Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:7bb35391f43775b91dfc322aef4713b99cf5c1c6087af99cf835a0d8d8e14682","observation_id":"30f61f55-cba1-4e3f-a883-b3206a34dc19","resolution":{"observed_at":"2026-08-16T10:21:49.651776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.332416Z","title":null,"venue":null,"work_id":"af0b6290-ca0c-4d1b-8356-11f6e2df0c66","year":2017},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.657683Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:b25a5cb2ace80c5ac64d400fd4e9a80666bf80e93094281c345fe293e5d40680","observation_id":"65828b5f-b308-497c-8aba-6460a924827f","resolution":{"observed_at":"2026-08-16T10:21:50.337117Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03197","last_updated":"2022-08-05T14:35:03Z","snapshot_observed_at":"2026-08-20T08:35:29.935993Z","submitted_at":"2022-08-05T14:35:03Z","title":"Low-Resource Dense Retrieval for Open-Domain Question Answering: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2208.03197","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.03197","snapshot_observed_at":"2026-08-16T10:21:49.878898Z","title":"Low-Resource Dense Retrieval for Open-Domain Question Answering: A Comprehensive Survey","venue":"cs.CL","work_id":"b60f285e-b1ae-404a-9d91-cc8f66162626","year":2022},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.662196Z"},"links":{"cited_paper":"/paper/2208.03197","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:218932193b1c564ec6bf66fdf813e501c24cd821167fc920690205d18798c49c","observation_id":"b4443859-4aa1-4012-81a0-67a318826652","resolution":{"observed_at":"2026-08-16T10:21:49.885984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.316311Z","title":"Alfworld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":"6a6b4a9e-0b3e-4046-9e2e-e76fce3be195","year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.666985Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:d5b9132e3eb058ed75d3da5df8f7ced27420cf3fa51dd358d19b4cf15bbd5fc8","observation_id":"eb57d2ce-ed14-4550-ac75-507f288f3fb1","resolution":{"observed_at":"2026-08-16T10:21:50.321635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.299950Z","title":null,"venue":null,"work_id":"4f8c08ba-c689-4abb-8b40-989f8e3f3b33","year":2018},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.671377Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:8a1855d118096adb4537e659f25e20050da819f9d87c3cbe667e36088806c5d0","observation_id":"a9f2111f-9563-4345-8202-27e2c972e4b4","resolution":{"observed_at":"2026-08-16T10:21:50.305262Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06563","last_updated":"2024-04-05T06:39:34Z","snapshot_observed_at":"2026-08-16T14:11:03.298420Z","submitted_at":"2024-03-11T10:05:29Z","title":"Unraveling the Mystery of Scaling Laws: Part I","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06563","snapshot_observed_at":"2026-08-16T10:21:49.676047Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.676047Z"},"links":{"cited_paper":"/paper/2403.06563","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:9f483f9ebc37c66b82983b5a23092fe6efe33bc1f1dc6b261b9c9767252db87c","observation_id":"b888589a-edab-4c13-83c9-95aeadb831cc","resolution":{"observed_at":"2026-08-16T10:21:49.676047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15971","last_updated":"2024-08-28T17:43:55Z","snapshot_observed_at":"2026-08-16T13:23:07.998172Z","submitted_at":"2024-08-28T17:43:55Z","title":"BattleAgentBench: A Benchmark for Evaluating Cooperation and Competition Capabilities of Language Models in Multi-Agent Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15971","snapshot_observed_at":"2026-08-16T10:21:49.681539Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.681539Z"},"links":{"cited_paper":"/paper/2408.15971","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:ca7068f75d8bf90d63876bd4ccd3c416e4209221ab1933643d67c8d1b0d927b8","observation_id":"54ca6850-b338-4c94-b88e-acb57778a5e9","resolution":{"observed_at":"2026-08-16T10:21:49.681539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.686442Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.686442Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:c03005f8f5ae3b821751c1af5076b08184c1ba7eaf0f7520e20aa48135873346","observation_id":"d34c7846-0827-4394-bdd9-fc5385dcd1e1","resolution":{"observed_at":"2026-08-16T10:21:49.686442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.691274Z","title":"White, Doug Burger, and Chi Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.691274Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:790b1716e0790be54a35503c177b829effdecb915addb251cd650a55b5ed0159","observation_id":"da51cf25-e026-403e-94b0-021d7af6ea23","resolution":{"observed_at":"2026-08-16T10:21:49.691274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.262626Z","title":null,"venue":null,"work_id":"ee446d58-4932-455f-b0c5-5e2ac83c3daa","year":2020},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.696426Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:809ae5513c25f635672ff1f2820bc0c687ee476950d7030ff45695c3a2332425","observation_id":"da0fd5ff-ca9e-4824-84d3-1e5d500f95b3","resolution":{"observed_at":"2026-08-16T10:21:50.267655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08562","last_updated":"2024-11-27T12:25:28Z","snapshot_observed_at":"2026-08-16T14:43:16.257066Z","submitted_at":"2023-11-14T21:46:27Z","title":"MAgIC: Investigation of Large Language Model Powered Multi-Agent in Cognition, Adaptability, Rationality and Collaboration","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08562","snapshot_observed_at":"2026-08-16T10:21:49.700947Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.700947Z"},"links":{"cited_paper":"/paper/2311.08562","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:f87535d3a085a56ac97be2ae8a2ca9ebb3747bc75b0b5ffaedb5d512dcbfa5e4","observation_id":"9588de65-7616-4efb-8f96-fdabfd61b7e4","resolution":{"observed_at":"2026-08-16T10:21:49.700947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.246572Z","title":null,"venue":null,"work_id":"db2c7dcf-0b6b-490a-bada-713a5d7cd049","year":2017},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.706236Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:05933a66eb1f657d1a690161d21ab49a029e3f2d0ff686a6b4f24e14631cdf51","observation_id":"3d884cf5-218e-47da-bf2a-9a9c8f64c5a2","resolution":{"observed_at":"2026-08-16T10:21:50.251556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00741","last_updated":"2024-12-05T07:05:59Z","snapshot_observed_at":"2026-08-16T17:40:14.613190Z","submitted_at":"2024-01-01T12:49:36Z","title":"ToolEyes: Fine-Grained Evaluation for Tool Learning Capabilities of Large Language Models in Real-world Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00741","snapshot_observed_at":"2026-08-16T10:21:49.710862Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.710862Z"},"links":{"cited_paper":"/paper/2401.00741","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:fc33755f59b9f4f0c4fe0c9d2315e6ea51c2995d320e1f55f4148e6652353af8","observation_id":"2b4826c8-68ad-4577-a980-ad5f6d85dd6d","resolution":{"observed_at":"2026-08-16T10:21:49.710862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08745","last_updated":"2021-12-16T09:54:23Z","snapshot_observed_at":"2026-08-16T17:34:09.043887Z","submitted_at":"2021-12-16T09:54:23Z","title":"Knowledge-enhanced Session-based Recommendation with Temporal Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08745","snapshot_observed_at":"2026-08-16T10:21:49.715495Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.715495Z"},"links":{"cited_paper":"/paper/2112.08745","citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:af84940da72fafb5b5b57ff64ad8b5c65b4fb5bf917f725bfdf3227f255c00a4","observation_id":"a289ea0b-7601-4b88-8f19-cbf8ca91265f","resolution":{"observed_at":"2026-08-16T10:21:49.715495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.720901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.720901Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:3f64675a89324a1c28f3da611af74607287b1efb2be78855d15513f4df15015c","observation_id":"c46572cd-07ab-4574-95ad-8b5e73b72c83","resolution":{"observed_at":"2026-08-16T10:21:49.720901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.219579Z","title":null,"venue":null,"work_id":"f47716d6-be20-4ce0-956e-54c069aeb813","year":2023},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.725651Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:fa37783d5cd6164d629cf37dfac26edebe240267fdf0cb5e3743d771df3abbdd","observation_id":"2b452bd1-b991-4a2a-9189-3a8a484554d1","resolution":{"observed_at":"2026-08-16T10:21:50.224775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:50.203497Z","title":null,"venue":null,"work_id":"299f7d4a-0159-488e-8672-db90bd7eea06","year":2024},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.731191Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:f5e56bba5bc8ac2a38720771800aeedf2ec8ca28398a0f692eb0ca1125063fd8","observation_id":"f5f49c78-7ecd-4ab4-9bfd-5c07af9187b4","resolution":{"observed_at":"2026-08-16T10:21:50.208632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.737029Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.737029Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:b32c9b6f32a8f6f7e6238e81b1f53a39b898887d9f91638f35b5eba6b2424d51","observation_id":"32ad9263-a574-4a58-9895-dd6b0988f1f2","resolution":{"observed_at":"2026-08-16T10:21:49.737029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:21:49.742464Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-16T10:21:49.742464Z"},"links":{"citing_paper":"/paper/2504.18373"},"observation_digest":"sha256:6c80ad2c6ce246613c659a1f4e8bfae102185a586727d814e2ed9d937f2367e6","observation_id":"d2ba333d-237a-4bfb-b996-5cce6c3d5794","resolution":{"observed_at":"2026-08-16T10:21:49.742464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.18373","last_updated":"2025-04-25T14:17:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T22:30:22.744308Z","submitted_at":"2025-04-25T14:17:47Z","title":"Auto-SLURP: A Benchmark Dataset for Evaluating Multi-Agent Frameworks in Smart Personal Assistant"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2504.18373."}